<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Fine-Tuning on 中文AI术语词典</title><link>https://terms-en.ai-term-hub.com/zh/tags/fine-tuning/</link><description>Recent content in Fine-Tuning on 中文AI术语词典</description><generator>Hugo</generator><language>zh-cn</language><lastBuildDate>Sat, 18 Jul 2026 11:44:45 +0000</lastBuildDate><atom:link href="https://terms-en.ai-term-hub.com/zh/tags/fine-tuning/index.xml" rel="self" type="application/rss+xml"/><item><title>前缀微调</title><link>https://terms-en.ai-term-hub.com/zh/terms/prefix_tuning/</link><pubDate>Sat, 18 Jul 2026 11:30:18 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/prefix_tuning/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>前缀微调是一种用于预训练变换器的参数高效适应技术。与更新所有模型权重不同，它在输入序列前prepend（前置）一系列可训练的连续向量（即前缀），从而冻结主干网络并仅优化少量参数以适应新任务。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>一种参数高效的微调方法，通过在变换器层的输入端添加可训练的连续向量来实现适配。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>参数高效微调&lt;/li>
&lt;li>软提示&lt;/li>
&lt;li>变换器层&lt;/li>
&lt;li>冻结主干&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>少样本学习适配&lt;/li>
&lt;li>资源受限下的多任务学习&lt;/li>
&lt;li>为利基领域定制大型语言模型&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/prompt_tuning-%E6%8F%90%E7%A4%BA%E5%BE%AE%E8%B0%83/">prompt_tuning (提示微调)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/p_tuning-p-tuning/">p_tuning (P-Tuning)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/adapter_modules-%E9%80%82%E9%85%8D%E5%99%A8%E6%A8%A1%E5%9D%97/">adapter_modules (适配器模块)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/peft-%E5%8F%82%E6%95%B0%E9%AB%98%E6%95%88%E5%BE%AE%E8%B0%83%E6%8A%80%E6%9C%AF/">peft (参数高效微调技术)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>P-Tuning</title><link>https://terms-en.ai-term-hub.com/zh/terms/p_tuning/</link><pubDate>Sat, 18 Jul 2026 11:29:14 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/p_tuning/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>P-Tuning（提示微调）是一种旨在以最低计算成本将大型预训练语言模型适配到特定下游任务的技术。与微调所有模型参数不同，P-Tuning 仅优化少量可学习的提示向量，同时保持预训练模型的权重冻结，从而显著降低资源消耗并防止灾难性遗忘。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>P-Tuning 是一种参数高效微调方法，它通过优化连续的提示嵌入（prompt embeddings）来适应任务，而不是更新整个预训练模型的权重。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>参数高效微调&lt;/li>
&lt;li>虚拟令牌&lt;/li>
&lt;li>冻结权重&lt;/li>
&lt;li>嵌入优化&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>少样本学习适配&lt;/li>
&lt;li>资源受限环境&lt;/li>
&lt;li>大语言模型应用的快速原型开发&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/lora-%E4%BD%8E%E7%A7%A9%E9%80%82%E5%BA%94/">LoRA (低秩适应)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/adapter-modules-%E9%80%82%E9%85%8D%E5%99%A8%E6%A8%A1%E5%9D%97/">Adapter Modules (适配器模块)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/prompt-engineering-%E6%8F%90%E7%A4%BA%E5%B7%A5%E7%A8%8B/">Prompt Engineering (提示工程)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/transfer-learning-%E8%BF%81%E7%A7%BB%E5%AD%A6%E4%B9%A0/">Transfer Learning (迁移学习)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>数据集:Jackrong/Qwen3.5 Reasoning 700X</title><link>https://terms-en.ai-term-hub.com/zh/terms/datasetjackrongqwen35_reasoning_700x/</link><pubDate>Sat, 18 Jul 2026 11:13:13 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/datasetjackrongqwen35_reasoning_700x/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>此条目指代标识符为 &amp;lsquo;Jackrong/Qwen3.5 Reasoning 700X&amp;rsquo; 的特定数据集仓库。它通常用于监督微调（SFT）或强化学习等场景，旨在提升模型的推理性能。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>由用户 Jackrong 在 Hugging Face 上托管的专业数据集，专为微调 Qwen 等大型语言模型以增强其复杂推理能力而精心策划。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>监督微调&lt;/li>
&lt;li>思维链&lt;/li>
&lt;li>推理增强&lt;/li>
&lt;li>Hugging Face Hub&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>针对数学或逻辑任务微调大语言模型&lt;/li>
&lt;li>基准测试推理能力的提升效果&lt;/li>
&lt;li>创建专门的推理助手&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E6%80%9D%E7%BB%B4%E9%93%BE-chain-of-thought/">思维链 (Chain-of-Thought)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E7%9B%91%E7%9D%A3%E5%BE%AE%E8%B0%83-supervised-fine-tuning/">监督微调 (Supervised Fine-Tuning)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/qwen/">Qwen&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/hugging-face-datasets/">Hugging Face Datasets&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>监督微调</title><link>https://terms-en.ai-term-hub.com/zh/terms/supervised_fine_tuning/</link><pubDate>Sat, 18 Jul 2026 11:02:04 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/supervised_fine_tuning/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>监督微调（SFT）涉及采用大型预训练模型（如语言模型），并在较小的高质量、针对特定下游任务标注的数据集上继续训练该模型。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>在特定数据集上进一步训练预训练模型，使其适应特定任务或领域的过程。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>预训练模型&lt;/li>
&lt;li>迁移学习&lt;/li>
&lt;li>指令微调&lt;/li>
&lt;li>领域适配&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>定制聊天机器人开发&lt;/li>
&lt;li>专业医疗问答系统&lt;/li>
&lt;li>代码生成助手&lt;/li>
&lt;/ul>
&lt;h2 id="code-example">Code Example&lt;/h2>
&lt;div class="highlight">&lt;pre tabindex="0" style="color:#f8f8f2;background-color:#272822;-moz-tab-size:4;-o-tab-size:4;tab-size:4;">&lt;code class="language-python" data-lang="python">&lt;span style="display:flex;">&lt;span>model&lt;span style="color:#f92672">.&lt;/span>train()
&lt;/span>&lt;/span>&lt;span style="display:flex;">&lt;span>&lt;span style="color:#66d9ef">for&lt;/span> batch &lt;span style="color:#f92672">in&lt;/span> dataloader:
&lt;/span>&lt;/span>&lt;span style="display:flex;">&lt;span> inputs, labels &lt;span style="color:#f92672">=&lt;/span> batch
&lt;/span>&lt;/span>&lt;span style="display:flex;">&lt;span> outputs &lt;span style="color:#f92672">=&lt;/span> model(inputs, labels&lt;span style="color:#f92672">=&lt;/span>labels)
&lt;/span>&lt;/span>&lt;span style="display:flex;">&lt;span> loss &lt;span style="color:#f92672">=&lt;/span> outputs&lt;span style="color:#f92672">.&lt;/span>loss
&lt;/span>&lt;/span>&lt;span style="display:flex;">&lt;span> loss&lt;span style="color:#f92672">.&lt;/span>backward()
&lt;/span>&lt;/span>&lt;span style="display:flex;">&lt;span> optimizer&lt;span style="color:#f92672">.&lt;/span>step()
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/div>&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E9%A2%84%E8%AE%AD%E7%BB%83-pre-training/">预训练 (Pre-training)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E5%9F%BA%E4%BA%8E%E4%BA%BA%E7%B1%BB%E5%8F%8D%E9%A6%88%E7%9A%84%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0-rlhf/">基于人类反馈的强化学习 (RLHF)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E6%8F%90%E7%A4%BA%E5%B7%A5%E7%A8%8B-prompt-engineering/">提示工程 (Prompt Engineering)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E5%A4%A7%E8%AF%AD%E8%A8%80%E6%A8%A1%E5%9E%8B-llm/">大语言模型 (LLM)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>QLoRA</title><link>https://terms-en.ai-term-hub.com/zh/terms/qlora/</link><pubDate>Sat, 18 Jul 2026 11:01:29 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/qlora/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>QLoRA 将低秩适应（LoRA）与 4 位量化相结合，显著减少了微调大规模模型所需的内存占用。通过将权重存储为 4 位格式并添加训练好的低秩适配器，该方法在保持性能的同时降低了资源需求。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>量化低秩适应，一种使用 4 位量化和低秩适配器高效微调大型语言模型的方法。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>低秩适应&lt;/li>
&lt;li>4 位量化&lt;/li>
&lt;li>内存效率&lt;/li>
&lt;li>微调&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>消费级 GPU 微调&lt;/li>
&lt;li>资源受限环境&lt;/li>
&lt;li>快速模型迭代&lt;/li>
&lt;/ul>
&lt;h2 id="code-example">Code Example&lt;/h2>
&lt;div class="highlight">&lt;pre tabindex="0" style="color:#f8f8f2;background-color:#272822;-moz-tab-size:4;-o-tab-size:4;tab-size:4;">&lt;code class="language-python" data-lang="python">&lt;span style="display:flex;">&lt;span>&lt;span style="color:#f92672">from&lt;/span> peft &lt;span style="color:#f92672">import&lt;/span> LoraConfig, get_peft_model
&lt;/span>&lt;/span>&lt;span style="display:flex;">&lt;span>config &lt;span style="color:#f92672">=&lt;/span> LoraConfig(r&lt;span style="color:#f92672">=&lt;/span>&lt;span style="color:#ae81ff">8&lt;/span>, lora_alpha&lt;span style="color:#f92672">=&lt;/span>&lt;span style="color:#ae81ff">32&lt;/span>, target_modules&lt;span style="color:#f92672">=&lt;/span>[&lt;span style="color:#e6db74">&amp;#34;q_proj&amp;#34;&lt;/span>, &lt;span style="color:#e6db74">&amp;#34;v_proj&amp;#34;&lt;/span>])
&lt;/span>&lt;/span>&lt;span style="display:flex;">&lt;span>model &lt;span style="color:#f92672">=&lt;/span> get_peft_model(base_model, config)
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/div>&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/lora/">LoRA&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E5%8F%82%E6%95%B0%E9%AB%98%E6%95%88%E5%BE%AE%E8%B0%83-peft/">参数高效微调 (PEFT)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E9%87%8F%E5%8C%96-quantization/">量化 (Quantization)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E5%8F%82%E6%95%B0%E9%AB%98%E6%95%88%E5%BE%AE%E8%B0%83-parameter-efficient-fine-tuning/">参数高效微调 (Parameter-Efficient Fine-Tuning)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>适配器</title><link>https://terms-en.ai-term-hub.com/zh/terms/adapter/</link><pubDate>Sat, 18 Jul 2026 10:59:15 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/adapter/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>适配器是一种参数高效的微调技术，主要用于大型语言模型和Transformer架构中。与计算成本高昂的更新所有模型权重不同，适配器仅训练少量新增参数，从而保留预训练知识并降低资源消耗。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>插入预训练模型中的轻量级模块，用于针对特定下游任务进行高效微调。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>参数高效微调&lt;/li>
&lt;li>迁移学习&lt;/li>
&lt;li>模块化架构&lt;/li>
&lt;li>灾难性遗忘&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>为客服聊天机器人微调大型语言模型&lt;/li>
&lt;li>适配视觉模型以进行医学图像分析&lt;/li>
&lt;li>高效部署多个领域特定的模型&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/lora-%E4%BD%8E%E7%A7%A9%E9%80%82%E5%BA%94/">LoRA (低秩适应)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/prompt-tuning-%E6%8F%90%E7%A4%BA%E5%BE%AE%E8%B0%83/">Prompt Tuning (提示微调)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/fine-tuning-%E5%BE%AE%E8%B0%83/">Fine-Tuning (微调)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/transformer-transformer%E6%9E%B6%E6%9E%84/">Transformer (Transformer架构)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>Reinforcement Learning from Human Feedback（基于人类反馈的强化学习）</title><link>https://terms-en.ai-term-hub.com/zh/terms/rlhf/</link><pubDate>Sat, 18 Jul 2026 10:54:14 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/rlhf/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>基于人类反馈的强化学习（RLHF）是一种用于微调大型语言模型的方法，使其输出更好地符合人类的价值观和期望。它通常包括三个步骤：收集人类偏好数据、训练奖励模型以及使用强化学习算法（如PPO）优化模型。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>RLHF是一种利用人类反馈训练奖励模型，从而使AI模型符合人类偏好的技术。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>偏好数据&lt;/li>
&lt;li>奖励模型&lt;/li>
&lt;li>对齐&lt;/li>
&lt;li>PPO（近端策略优化）&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>聊天机器人优化&lt;/li>
&lt;li>内容审核&lt;/li>
&lt;li>提高指令遵循能力&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/supervised-fine-tuning-%E7%9B%91%E7%9D%A3%E5%BE%AE%E8%B0%83/">Supervised Fine-Tuning（监督微调）&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/preference-optimization-%E5%81%8F%E5%A5%BD%E4%BC%98%E5%8C%96/">Preference Optimization（偏好优化）&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/dpo-%E7%9B%B4%E6%8E%A5%E5%81%8F%E5%A5%BD%E4%BC%98%E5%8C%96/">DPO（直接偏好优化）&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>低秩自适应 (LoRA)</title><link>https://terms-en.ai-term-hub.com/zh/terms/lora/</link><pubDate>Sat, 18 Jul 2026 10:52:16 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/lora/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>LoRA冻结预训练模型的权重，并在Transformer架构的每一层中插入可训练的分解矩阵。通过仅优化这些低秩矩阵，LoRA显著减少&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>低秩自适应是一种参数高效的微调方法，它将可训练的秩分解矩阵注入现有模型权重中。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>参数高效微调&lt;/li>
&lt;li>秩分解&lt;/li>
&lt;li>权重冻结&lt;/li>
&lt;li>适配器模块&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>定制大语言模型&lt;/li>
&lt;li>领域特定适配&lt;/li>
&lt;li>资源受限的训练环境&lt;/li>
&lt;/ul>
&lt;h2 id="code-example">Code Example&lt;/h2>
&lt;div class="highlight">&lt;pre tabindex="0" style="color:#f8f8f2;background-color:#272822;-moz-tab-size:4;-o-tab-size:4;tab-size:4;">&lt;code class="language-python" data-lang="python">&lt;span style="display:flex;">&lt;span>&lt;span style="color:#f92672">from&lt;/span> peft &lt;span style="color:#f92672">import&lt;/span> LoraConfig, get_peft_model
&lt;/span>&lt;/span>&lt;span style="display:flex;">&lt;span>config &lt;span style="color:#f92672">=&lt;/span> LoraConfig(r&lt;span style="color:#f92672">=&lt;/span>&lt;span style="color:#ae81ff">8&lt;/span>, lora_alpha&lt;span style="color:#f92672">=&lt;/span>&lt;span style="color:#ae81ff">32&lt;/span>)
&lt;/span>&lt;/span>&lt;span style="display:flex;">&lt;span>model &lt;span style="color:#f92672">=&lt;/span> get_peft_model(base_model, config)
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/div>&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/peft-%E5%8F%82%E6%95%B0%E9%AB%98%E6%95%88%E5%BE%AE%E8%B0%83%E6%8A%80%E6%9C%AF/">PEFT (参数高效微调技术)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E5%BE%AE%E8%B0%83-fine-tuning/">微调 (Fine-Tuning)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E9%87%8F%E5%8C%96-quantization/">量化 (Quantization)&lt;/a>&lt;/li>
&lt;/ul></description></item></channel></rss>