<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Pretraining on 中文AI术语词典</title><link>https://terms-en.ai-term-hub.com/zh/tags/pretraining/</link><description>Recent content in Pretraining on 中文AI术语词典</description><generator>Hugo</generator><language>zh-cn</language><lastBuildDate>Sat, 18 Jul 2026 11:44:45 +0000</lastBuildDate><atom:link href="https://terms-en.ai-term-hub.com/zh/tags/pretraining/index.xml" rel="self" type="application/rss+xml"/><item><title>预测学习</title><link>https://terms-en.ai-term-hub.com/zh/terms/predictive_learning/</link><pubDate>Sat, 18 Jul 2026 11:30:18 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/predictive_learning/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>预测学习涉及训练神经网络，使其能够从观测到的输入中推断未观测到的数据点，而无需显式的人工标签。通过解决诸如语言中的下一个词元预测或图像中的掩码建模等任务，模型能够学习到强大的数据表示。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>一种自监督方法，模型通过预测输入数据的缺失部分来学习表示。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>自监督&lt;/li>
&lt;li>掩码建模&lt;/li>
&lt;li>表示学习&lt;/li>
&lt;li>无标签数据&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>预训练大型语言模型&lt;/li>
&lt;li>图像修复任务&lt;/li>
&lt;li>时间序列异常检测&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/self_supervised_learning-%E8%87%AA%E7%9B%91%E7%9D%A3%E5%AD%A6%E4%B9%A0/">self_supervised_learning (自监督学习)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/masked_language_modeling-%E6%8E%A9%E7%A0%81%E8%AF%AD%E8%A8%80%E5%BB%BA%E6%A8%A1/">masked_language_modeling (掩码语言建模)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/contrastive_learning-%E5%AF%B9%E6%AF%94%E5%AD%A6%E4%B9%A0/">contrastive_learning (对比学习)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/autoencoder-%E8%87%AA%E7%BC%96%E7%A0%81%E5%99%A8/">autoencoder (自编码器)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>掩码填充</title><link>https://terms-en.ai-term-hub.com/zh/terms/fill_mask/</link><pubDate>Sat, 18 Jul 2026 11:17:25 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/fill_mask/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>掩码填充是 BERT 等基于 Transformer 模型中使用的一种基本预训练目标。该过程涉及掩盖文本序列中的随机标记，并训练模型预测被掩盖的原始标记，从而学习语言的深层语义表示。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>一种自然语言处理任务，模型根据上下文预测句子中缺失的标记。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>掩码语言建模&lt;/li>
&lt;li>上下文理解&lt;/li>
&lt;li>自监督学习&lt;/li>
&lt;li>标记预测&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>文本补全&lt;/li>
&lt;li>语义角色标注&lt;/li>
&lt;li>预训练基础&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/bert-%E5%8F%8C%E5%90%91%E7%BC%96%E7%A0%81%E5%99%A8%E8%A1%A8%E7%A4%BA/">BERT (双向编码器表示)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/masked-language-model-%E6%8E%A9%E7%A0%81%E8%AF%AD%E8%A8%80%E6%A8%A1%E5%9E%8B/">Masked Language Model (掩码语言模型)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/transformer-%E8%BD%AC%E6%8D%A2%E5%99%A8%E6%9E%B6%E6%9E%84/">Transformer (转换器架构)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/tokenization-%E5%88%86%E8%AF%8D/">Tokenization (分词)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>数据集：Tiiuae/Falcon Refinedweb</title><link>https://terms-en.ai-term-hub.com/zh/terms/datasettiiuaefalcon_refinedweb/</link><pubDate>Sat, 18 Jul 2026 11:13:26 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/datasettiiuaefalcon_refinedweb/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>RefinedWeb 是一个经过过滤的网页大规模数据集，专为预训练基础模型而设计。它处理数十亿个网页，以去除低质量内容、重复项和有害材料。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>由技术创新研究所（TII）策划的大规模高质量网页数据集，用于预训练像 Falcon 这样的大型语言模型。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>数据过滤&lt;/li>
&lt;li>预训练语料库&lt;/li>
&lt;li>网页抓取&lt;/li>
&lt;li>质量控制&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>预训练大型语言模型&lt;/li>
&lt;li>比较数据质量对模型性能的影响&lt;/li>
&lt;li>构建高效的训练管道&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/common-crawl-%E9%80%9A%E7%94%A8%E7%BD%91%E7%BB%9C%E7%88%AC%E8%99%AB%E6%95%B0%E6%8D%AE/">Common Crawl (通用网络爬虫数据)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/the-pile-%E6%B7%B7%E5%90%88%E9%A2%84%E8%AE%AD%E7%BB%83%E6%95%B0%E6%8D%AE%E9%9B%86/">The Pile (混合预训练数据集)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/falcon-llm-falcon%E5%A4%A7%E5%9E%8B%E8%AF%AD%E8%A8%80%E6%A8%A1%E5%9E%8B/">Falcon LLM (Falcon大型语言模型)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/data-cleaning-%E6%95%B0%E6%8D%AE%E6%B8%85%E6%B4%97/">Data Cleaning (数据清洗)&lt;/a>&lt;/li>
&lt;/ul></description></item></channel></rss>