<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Datasets on 中文AI术语词典</title><link>https://terms-en.ai-term-hub.com/zh/tags/datasets/</link><description>Recent content in Datasets on 中文AI术语词典</description><generator>Hugo</generator><language>zh-cn</language><lastBuildDate>Sat, 18 Jul 2026 11:44:45 +0000</lastBuildDate><atom:link href="https://terms-en.ai-term-hub.com/zh/tags/datasets/index.xml" rel="self" type="application/rss+xml"/><item><title>数据集：TriviaQA</title><link>https://terms-en.ai-term-hub.com/zh/terms/datasettrivia_qa/</link><pubDate>Sat, 18 Jul 2026 11:13:38 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/datasettrivia_qa/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>TriviaQA 是一个专为开放域问答设计的数据集，包含超过一百万个问题及其对应的答案。该数据集旨在通过要求模型进行多步推理和知识整合来挑战现有模型的性能。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>一个用于开放域问答的大规模数据集，包含数百万个问题及其答案，涵盖各种 trivia（冷知识）领域。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>开放域问答&lt;/li>
&lt;li>多跳推理&lt;/li>
&lt;li>知识整合&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>训练检索增强生成模型&lt;/li>
&lt;li>评估大语言模型的事实一致性&lt;/li>
&lt;li>基准测试基于知识的问答系统&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/squad-%E6%96%AF%E5%9D%A6%E7%A6%8F%E9%97%AE%E7%AD%94%E6%95%B0%E6%8D%AE%E9%9B%86/">SQuAD (斯坦福问答数据集)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/hotpotqa-%E7%83%AD%E7%82%B9%E9%97%AE%E7%AD%94%E6%95%B0%E6%8D%AE%E9%9B%86/">HotpotQA (热点问答数据集)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/natural-questions-%E8%87%AA%E7%84%B6%E9%97%AE%E9%A2%98%E6%95%B0%E6%8D%AE%E9%9B%86/">Natural Questions (自然问题数据集)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/retrieval-augmented-generation-%E6%A3%80%E7%B4%A2%E5%A2%9E%E5%BC%BA%E7%94%9F%E6%88%90/">Retrieval-Augmented Generation (检索增强生成)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>数据集：WikiHow</title><link>https://terms-en.ai-term-hub.com/zh/terms/datasetwikihow/</link><pubDate>Sat, 18 Jul 2026 11:13:38 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/datasetwikihow/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>WikiHow 数据集包含从 WikiHow 网站收集的约 60,000 篇操作指南文章。它广泛应用于自然语言处理研究中，用于抽象式文本摘要、步骤提取等任务。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>一个由 WikiHow 上的操作指南文章组成的大规模数据集，主要用于文本摘要和指令生成任务。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>文本摘要&lt;/li>
&lt;li>程序性文本&lt;/li>
&lt;li>指令提取&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>抽象式摘要模型训练&lt;/li>
&lt;li>分步指令生成&lt;/li>
&lt;li>理解程序性语言结构&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/cnn-dailymail-cnn-%E6%AF%8F%E6%97%A5%E9%82%AE%E6%8A%A5%E6%95%B0%E6%8D%AE%E9%9B%86/">CNN/DailyMail (CNN/每日邮报数据集)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/xsum-%E6%9E%81%E7%AB%AF%E6%91%98%E8%A6%81%E6%95%B0%E6%8D%AE%E9%9B%86/">XSum (极端摘要数据集)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/text-summarization-%E6%96%87%E6%9C%AC%E6%91%98%E8%A6%81/">Text Summarization (文本摘要)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/instruction-tuning-%E6%8C%87%E4%BB%A4%E5%BE%AE%E8%B0%83/">Instruction Tuning (指令微调)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>数据集：Wikipedia</title><link>https://terms-en.ai-term-hub.com/zh/terms/datasetwikipedia/</link><pubDate>Sat, 18 Jul 2026 11:13:38 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/datasetwikipedia/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>维基百科是可用文本格式的人类知识最大且最全面的集合之一。在人工智能领域，它是预训练大型语言模型的主要来源，提供了丰富的语言模式和事实知识。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>来自维基百科的海量文本集合，作为预训练语言模型和知识密集型自然语言处理任务的基础语料库。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>预训练语料库&lt;/li>
&lt;li>知识库&lt;/li>
&lt;li>语言多样性&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>预训练基础语言模型&lt;/li>
&lt;li>实体链接与消歧&lt;/li>
&lt;li>事实核查与知识检索&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/common-crawl-%E9%80%9A%E7%94%A8%E7%BD%91%E9%A1%B5%E7%88%AC%E5%8F%96%E6%95%B0%E6%8D%AE/">Common Crawl (通用网页爬取数据)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/bookcorpus-%E4%B9%A6%E7%B1%8D%E8%AF%AD%E6%96%99%E5%BA%93/">BookCorpus (书籍语料库)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/bert-%E5%8F%8C%E5%90%91%E7%BC%96%E7%A0%81%E5%99%A8%E8%A1%A8%E7%A4%BAtransformer/">BERT (双向编码器表示Transformer)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/knowledge-graph-%E7%9F%A5%E8%AF%86%E5%9B%BE%E8%B0%B1/">Knowledge Graph (知识图谱)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>数据集：Yahoo Answers Topics</title><link>https://terms-en.ai-term-hub.com/zh/terms/datasetyahoo_answers_topics/</link><pubDate>Sat, 18 Jul 2026 11:13:38 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/datasetyahoo_answers_topics/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>Yahoo Answers Topics 数据集是更大的雅虎问答档案的子集，专注于组织成不同主题类别的问题和答案。它常用于文本分类、语义相似性分析和非正式语言模式研究。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>源自雅虎问答的数据集，包含按特定主题分类的用户生成问题和答案，用于语义匹配和分类任务。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>文本分类&lt;/li>
&lt;li>语义相似度&lt;/li>
&lt;li>用户生成内容&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>训练问题分类模型&lt;/li>
&lt;li>语义文本相似度基准测试&lt;/li>
&lt;li>分析非正式语言模式&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/ag-news-ag%E6%96%B0%E9%97%BB%E6%95%B0%E6%8D%AE%E9%9B%86/">AG News (AG新闻数据集)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/snli-%E6%96%AF%E5%9D%A6%E7%A6%8F%E8%87%AA%E7%84%B6%E8%AF%AD%E8%A8%80%E6%8E%A8%E7%90%86%E8%AF%AD%E6%96%99%E5%BA%93/">SNLI (斯坦福自然语言推理语料库)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/text-classification-%E6%96%87%E6%9C%AC%E5%88%86%E7%B1%BB/">Text Classification (文本分类)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/semantic-search-%E8%AF%AD%E4%B9%89%E6%90%9C%E7%B4%A2/">Semantic Search (语义搜索)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>数据集：Nvidia/Helpsteer2</title><link>https://terms-en.ai-term-hub.com/zh/terms/datasetnvidiahelpsteer2/</link><pubDate>Sat, 18 Jul 2026 11:13:26 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/datasetnvidiahelpsteer2/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>Helpsteer2 是由 NVIDIA 发布的一个精心策划的数据集，包含由大型语言模型生成的响应的成对比较。它侧重于多维度的偏好，如有用性、诚实度等。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>一个专为在人类反馈强化学习（RLHF）中训练奖励模型而设计的高质量人类偏好数据集。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>RLHF&lt;/li>
&lt;li>奖励建模&lt;/li>
&lt;li>人类偏好&lt;/li>
&lt;li>对齐&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>为LLM对齐训练奖励模型&lt;/li>
&lt;li>评估模型的有用性和安全性&lt;/li>
&lt;li>使用偏好数据微调基础模型&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/rlhf-%E4%BA%BA%E7%B1%BB%E5%8F%8D%E9%A6%88%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0/">RLHF (人类反馈强化学习)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/reward-model-%E5%A5%96%E5%8A%B1%E6%A8%A1%E5%9E%8B/">Reward Model (奖励模型)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/dpo-%E7%9B%B4%E6%8E%A5%E5%81%8F%E5%A5%BD%E4%BC%98%E5%8C%96/">DPO (直接偏好优化)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/anthropic-hh-anthropic-%E4%BA%BA%E7%B1%BB%E5%B8%AE%E5%8A%A9%E6%95%B0%E6%8D%AE%E9%9B%86/">Anthropic HH (Anthropic 人类帮助数据集)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>数据集：S2ORC</title><link>https://terms-en.ai-term-hub.com/zh/terms/datasets2orc/</link><pubDate>Sat, 18 Jul 2026 11:13:26 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/datasets2orc/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>S2ORC 是从 Semantic Scholar 派生的学术文章综合语料库。它包括数百万篇跨各个科学领域的论文的全文本内容、元数据和引用关系。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>Semantic Scholar开放研究语料库，一个包含结构化元数据和引用网络的大规模学术论文数据集。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>学术自然语言处理&lt;/li>
&lt;li>引用网络&lt;/li>
&lt;li>元数据&lt;/li>
&lt;li>学术数据&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>构建引用推荐系统&lt;/li>
&lt;li>科学文本分类&lt;/li>
&lt;li>从研究论文中提取实体&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/semantic-scholar-%E8%AF%AD%E4%B9%89%E5%AD%A6%E8%80%85%E6%90%9C%E7%B4%A2%E5%BC%95%E6%93%8E/">Semantic Scholar (语义学者搜索引擎)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/acl-anthology-%E8%AE%A1%E7%AE%97%E8%AF%AD%E8%A8%80%E5%AD%A6%E5%8D%8F%E4%BC%9A%E8%AE%BA%E6%96%87%E9%9B%86/">ACL Anthology (计算语言学协会论文集)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/arxiv-%E9%A2%84%E5%8D%B0%E6%9C%AC%E6%9C%8D%E5%8A%A1%E5%99%A8/">ArXiv (预印本服务器)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/citation-prediction-%E5%BC%95%E7%94%A8%E9%A2%84%E6%B5%8B/">Citation Prediction (引用预测)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>数据集：嵌入数据/Wikianswers</title><link>https://terms-en.ai-term-hub.com/zh/terms/datasetembedding_datawikianswers/</link><pubDate>Sat, 18 Jul 2026 11:13:01 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/datasetembedding_datawikianswers/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>该数据集包含从已停用的 WikiAnswers 平台抓取的海量问答对。它主要用于训练稠密段落检索和语义匹配模型。通过利&amp;hellip;&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>一个包含来自 WikiAnswers 的问题-答案对的数据集，用于训练理解意图和语义等价性的模型。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>问答系统&lt;/li>
&lt;li>语义匹配&lt;/li>
&lt;li>意图识别&lt;/li>
&lt;li>问答对&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>训练问答机器人&lt;/li>
&lt;li>优化语义搜索&lt;/li>
&lt;li>查询扩展技术&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/dense-passage-retrieval-%E7%A8%A0%E5%AF%86%E6%AE%B5%E8%90%BD%E6%A3%80%E7%B4%A2/">Dense Passage Retrieval (稠密段落检索)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/conversational-ai-%E5%AF%B9%E8%AF%9D%E5%BC%8F%E4%BA%BA%E5%B7%A5%E6%99%BA%E8%83%BD/">Conversational AI (对话式人工智能)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/information-retrieval-%E4%BF%A1%E6%81%AF%E6%A3%80%E7%B4%A2/">Information Retrieval (信息检索)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>数据集：嵌入数据/简单维基百科</title><link>https://terms-en.ai-term-hub.com/zh/terms/datasetembedding_datasimple_wiki/</link><pubDate>Sat, 18 Jul 2026 11:13:01 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/datasetembedding_datasimple_wiki/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>该数据集由从简单英语维基百科中提取的句子和段落组成。简单英语维基百科是面向非母语用户的维基百科版本，其语法和词汇经过简化。它作为&amp;hellip;&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>一个源自简单英语维基百科的精选数据集，用于训练和评估文本嵌入模型。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>语义嵌入&lt;/li>
&lt;li>文本简化&lt;/li>
&lt;li>维基百科语料库&lt;/li>
&lt;li>模型基准测试&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>训练轻量级嵌入模型&lt;/li>
&lt;li>在简单语境中评估语义相似度&lt;/li>
&lt;li>提升自然语言处理工具的无障碍访问性&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/sentence-transformers-%E5%8F%A5%E5%AD%90%E5%8F%98%E6%8D%A2%E5%99%A8-%E5%8F%A5%E5%AD%90%E8%BD%AC%E6%8D%A2%E5%99%A8/">Sentence Transformers (句子变换器/句子转换器)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/semantic-search-%E8%AF%AD%E4%B9%89%E6%90%9C%E7%B4%A2/">Semantic Search (语义搜索)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/natural-language-processing-%E8%87%AA%E7%84%B6%E8%AF%AD%E8%A8%80%E5%A4%84%E7%90%86/">Natural Language Processing (自然语言处理)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>数据集：嵌入数据/Altlex</title><link>https://terms-en.ai-term-hub.com/zh/terms/datasetembedding_dataaltlex/</link><pubDate>Sat, 18 Jul 2026 11:12:55 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/datasetembedding_dataaltlex/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>Altlex 数据集由共享相同底层含义但使用不同词汇或句法结构的句子对组成。它主要用于训练嵌入模型，以捕捉语义上的等价关系。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>包含用于训练模型进行语义等价和同义句检测的替代词汇形式的语料库。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>语义等价&lt;/li>
&lt;li>同义句检测&lt;/li>
&lt;li>词汇变化&lt;/li>
&lt;li>向量相似度&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>训练语义搜索引擎&lt;/li>
&lt;li>改进问答系统&lt;/li>
&lt;li>增强文本相似度度量&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E8%AF%AD%E4%B9%89%E5%B5%8C%E5%85%A5-semantic-embeddings/">语义嵌入 (Semantic Embeddings)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E5%90%8C%E4%B9%89%E5%8F%A5%E8%AF%86%E5%88%AB-paraphrase-identification/">同义句识别 (Paraphrase Identification)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E8%AF%8D%E4%B9%89%E6%B6%88%E6%AD%A7-word-sense-disambiguation/">词义消歧 (Word Sense Disambiguation)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>数据集：嵌入数据/Flickr30K 描述</title><link>https://terms-en.ai-term-hub.com/zh/terms/datasetembedding_dataflickr30k_captions/</link><pubDate>Sat, 18 Jul 2026 11:12:55 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/datasetembedding_dataflickr30k_captions/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>Flickr30K Captions 是一个广泛使用的基准数据集，包含 31,783 张图像，每张图像都标注了五个不同的英文句子来描述视觉内容。它作为构建跨模态理解模型的基础资源。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>一个多模态数据集，将 31,000 张图像与人工生成的描述相关联，用于训练跨模态嵌入模型。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>多模态学习&lt;/li>
&lt;li>图文对齐&lt;/li>
&lt;li>跨模态检索&lt;/li>
&lt;li>视觉定位&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>构建图像搜索引擎&lt;/li>
&lt;li>生成图像描述&lt;/li>
&lt;li>训练视觉-语言模型&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/clip-%E6%A8%A1%E5%9E%8B-clip-model/">CLIP 模型 (CLIP Model)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E8%A7%86%E8%A7%89-%E8%AF%AD%E8%A8%80%E9%A2%84%E8%AE%AD%E7%BB%83-visual-language-pretraining/">视觉-语言预训练 (Visual-Language Pretraining)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E5%9B%BE%E5%83%8F%E6%8F%8F%E8%BF%B0%E7%94%9F%E6%88%90-image-captioning/">图像描述生成 (Image Captioning)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>数据集：嵌入数据/PAQ 对</title><link>https://terms-en.ai-term-hub.com/zh/terms/datasetembedding_datapaq_pairs/</link><pubDate>Sat, 18 Jul 2026 11:12:55 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/datasetembedding_datapaq_pairs/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>PAQ（伪答案质量）数据集包含从维基百科中提取的数百万个自动生成的问答对。它是专门为提供训练稠密检索器所需的数据而设计的。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>一个源自维基百科的大规模问答对数据集，旨在用于稠密段落检索的训练。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>稠密段落检索&lt;/li>
&lt;li>负采样&lt;/li>
&lt;li>开放域问答&lt;/li>
&lt;li>维基百科提取&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>训练稠密检索器&lt;/li>
&lt;li>开放域问答&lt;/li>
&lt;li>评估检索性能&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/dpr-dense-passage-retrieval/">DPR (Dense Passage Retrieval)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E5%8F%8C%E7%BC%96%E7%A0%81%E5%99%A8-bi-encoder/">双编码器 (Bi-Encoder)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E7%9F%A5%E8%AF%86%E5%BA%93-knowledge-base/">知识库 (Knowledge Base)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>数据集：嵌入数据/QQP</title><link>https://terms-en.ai-term-hub.com/zh/terms/datasetembedding_dataqqp/</link><pubDate>Sat, 18 Jul 2026 11:12:55 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/datasetembedding_dataqqp/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>Quora 问题对（QQP）是一个二元分类数据集，包含来自 Quora 平台的超过 40 万个问题对。其任务是确定两个问题是否具有相同的意图或含义。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>Quora 问题对数据集，用于训练模型检测问题之间的语义相似度。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>语义文本相似度&lt;/li>
&lt;li>二元分类&lt;/li>
&lt;li>意图匹配&lt;/li>
&lt;li>句子嵌入&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>重复问题检测&lt;/li>
&lt;li>微调句子转换器&lt;/li>
&lt;li>改进 FAQ 机器人&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/sts-benchmark/">STS Benchmark&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E5%AD%AA%E7%94%9F%E7%BD%91%E7%BB%9C-siamese-networks/">孪生网络 (Siamese Networks)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E6%96%87%E6%9C%AC%E8%95%B4%E5%90%AB-textual-entailment/">文本蕴含 (Textual Entailment)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>数据集：嵌入数据/句子压缩</title><link>https://terms-en.ai-term-hub.com/zh/terms/datasetembedding_datasentence_compression/</link><pubDate>Sat, 18 Jul 2026 11:12:55 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/datasetembedding_datasentence_compression/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>句子压缩数据集由成对的句子组成，其中目标句子是源句子的缩短版本，在去除冗余信息的同时保留核心含义。这些数据集常用于训练能够理解信息密度的模型。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>包含原始句子及其压缩版本的数据集，用于训练模型在保留信息方面的能力。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>信息密度&lt;/li>
&lt;li>结构简化&lt;/li>
&lt;li>摘要&lt;/li>
&lt;li>语义保留&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>自动文本摘要&lt;/li>
&lt;li>训练感知压缩的嵌入模型&lt;/li>
&lt;li>改进可读性指标&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E6%96%87%E6%9C%AC%E6%91%98%E8%A6%81-text-summarization/">文本摘要 (Text Summarization)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E6%8A%BD%E8%B1%A1%E5%BC%8F%E5%8E%8B%E7%BC%A9-abstractive-compression/">抽象式压缩 (Abstractive Compression)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E8%AF%AD%E8%A8%80%E6%95%88%E7%8E%87-linguistic-efficiency/">语言效率 (Linguistic Efficiency)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>数据集：Bigcode/The Stack Dedup</title><link>https://terms-en.ai-term-hub.com/zh/terms/datasetbigcodethe_stack_dedup/</link><pubDate>Sat, 18 Jul 2026 11:12:42 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/datasetbigcodethe_stack_dedup/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>The Stack Dedup 是 The Stack（一个庞大的开源代码仓库）的一个专用子集。它应用严格的技术来消除冗余的代码片段，从而避免大型语言模型在训练时产生偏差。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>由 BigCode 整理的 The Stack 数据集的去重版本，旨在移除近乎重复的代码片段，以提供更清洁的训练数据。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>去重&lt;/li>
&lt;li>代码大语言模型&lt;/li>
&lt;li>数据质量&lt;/li>
&lt;li>The Stack&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>训练代码生成模型&lt;/li>
&lt;li>评估编码能力基准测试&lt;/li>
&lt;li>减少训练冗余&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/the-stack/">The Stack&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/bigcode/">BigCode&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E4%BB%A3%E7%A0%81%E6%90%9C%E7%B4%A2-code-search/">代码搜索 (Code Search)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E5%A4%A7%E6%A8%A1%E5%9E%8B%E8%AE%AD%E7%BB%83%E6%95%B0%E6%8D%AE-llm-training-data/">大模型训练数据 (LLM Training Data)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>数据集：BookCorpus</title><link>https://terms-en.ai-term-hub.com/zh/terms/datasetbookcorpus/</link><pubDate>Sat, 18 Jul 2026 11:12:42 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/datasetbookcorpus/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>BookCorpus 是从互联网上爬取的来自 10,000 多本未出版书籍的文本集合。它是训练和评估自然语言处理（NLP）模型的基础资源。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>一个包含超过 10,000 本未出版书籍的大规模数据集，广泛用于自然语言处理模型的预训练。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>NLP 预训练&lt;/li>
&lt;li>文本语料库&lt;/li>
&lt;li>语言模型&lt;/li>
&lt;li>未出版书籍&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>预训练 Transformer 模型&lt;/li>
&lt;li>评估语言流畅度&lt;/li>
&lt;li>文学文本分析&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/wikitext/">WikiText&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/common-crawl/">Common Crawl&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/bert/">BERT&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/gpt/">GPT&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>数据集：Eli5</title><link>https://terms-en.ai-term-hub.com/zh/terms/dataseteli5/</link><pubDate>Sat, 18 Jul 2026 11:12:42 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/dataseteli5/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>ELI5（Explain Like I&amp;rsquo;m Five）是一个源自同名 Reddit 社区的数据集。它由用户提交的问题以及社区提供的详细、简化的答案组成。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>一个大规模的问答数据集，格式化为“像五岁孩子一样解释”（Explain Like I&amp;rsquo;m Five），侧重于详细的解释。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>问答系统&lt;/li>
&lt;li>长文本生成&lt;/li>
&lt;li>Reddit 数据&lt;/li>
&lt;li>解释生成&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>训练问答机器人&lt;/li>
&lt;li>生成教育内容&lt;/li>
&lt;li>研究对话动态&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/squad/">SQuAD&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/hotpotqa/">HotpotQA&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E5%AF%B9%E8%AF%9D%E5%BC%8F-ai-conversational-ai/">对话式 AI (Conversational AI)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E6%96%87%E6%9C%AC%E6%91%98%E8%A6%81-text-summarization/">文本摘要 (Text Summarization)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>AZFinText</title><link>https://terms-en.ai-term-hub.com/zh/terms/azfintext/</link><pubDate>Sat, 18 Jul 2026 11:04:01 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/azfintext/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>AZFinText 是一个大规模标注语料库，专门针对中文金融文本分析而策划。它包括带有金融情感标签的新闻文章、报告和社会媒体帖子，旨在支持高精度的金融自然语言处理任务。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>AZFinText 是一个专为中文语境下的金融文本挖掘和情感分析设计的专用数据集。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>金融自然语言处理&lt;/li>
&lt;li>情感分析&lt;/li>
&lt;li>中文文本挖掘&lt;/li>
&lt;li>数据集&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>训练金融情感分类器&lt;/li>
&lt;li>开发股票预测模型&lt;/li>
&lt;li>计算金融学研究&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/finbert-%E9%87%91%E8%9E%8D%E9%A2%86%E5%9F%9F%E9%A2%84%E8%AE%AD%E7%BB%83%E8%AF%AD%E8%A8%80%E6%A8%A1%E5%9E%8B/">FinBERT (金融领域预训练语言模型)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/sentiment-analysis-%E6%83%85%E6%84%9F%E5%88%86%E6%9E%90/">Sentiment Analysis (情感分析)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/corpus-linguistics-%E8%AF%AD%E6%96%99%E5%BA%93%E8%AF%AD%E8%A8%80%E5%AD%A6/">Corpus Linguistics (语料库语言学)&lt;/a>&lt;/li>
&lt;/ul></description></item></channel></rss>