<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Text Data on 中文AI术语词典</title><link>https://terms-en.ai-term-hub.com/zh/tags/text-data/</link><description>Recent content in Text Data on 中文AI术语词典</description><generator>Hugo</generator><language>zh-cn</language><lastBuildDate>Sat, 18 Jul 2026 11:44:45 +0000</lastBuildDate><atom:link href="https://terms-en.ai-term-hub.com/zh/tags/text-data/index.xml" rel="self" type="application/rss+xml"/><item><title>数据集：BookCorpus</title><link>https://terms-en.ai-term-hub.com/zh/terms/datasetbookcorpus/</link><pubDate>Sat, 18 Jul 2026 11:12:42 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/datasetbookcorpus/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>BookCorpus 是从互联网上爬取的来自 10,000 多本未出版书籍的文本集合。它是训练和评估自然语言处理（NLP）模型的基础资源。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>一个包含超过 10,000 本未出版书籍的大规模数据集，广泛用于自然语言处理模型的预训练。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>NLP 预训练&lt;/li>
&lt;li>文本语料库&lt;/li>
&lt;li>语言模型&lt;/li>
&lt;li>未出版书籍&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>预训练 Transformer 模型&lt;/li>
&lt;li>评估语言流畅度&lt;/li>
&lt;li>文学文本分析&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/wikitext/">WikiText&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/common-crawl/">Common Crawl&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/bert/">BERT&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/gpt/">GPT&lt;/a>&lt;/li>
&lt;/ul></description></item></channel></rss>