<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Alignment on 中文AI术语词典</title><link>https://terms-en.ai-term-hub.com/zh/tags/alignment/</link><description>Recent content in Alignment on 中文AI术语词典</description><generator>Hugo</generator><language>zh-cn</language><lastBuildDate>Sat, 18 Jul 2026 11:44:45 +0000</lastBuildDate><atom:link href="https://terms-en.ai-term-hub.com/zh/tags/alignment/index.xml" rel="self" type="application/rss+xml"/><item><title>推理心理学</title><link>https://terms-en.ai-term-hub.com/zh/terms/psychology_of_reasoning/</link><pubDate>Sat, 18 Jul 2026 11:30:52 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/psychology_of_reasoning/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>该领域考察人类演绎、归纳和溯因推理背后的心理过程。它探索指导人类思维的偏见、启发式方法和逻辑结构。在人工智能中，对这些心理机制的理解有助于设计更符合人类认知习惯、更具可解释性且能与人类良好对齐的AI系统。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>跨学科研究人类如何形成判断、做出决策和解决问题的领域，为认知AI架构提供启示。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>认知偏差&lt;/li>
&lt;li>启发式处理&lt;/li>
&lt;li>逻辑演绎&lt;/li>
&lt;li>人机对齐&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>设计可解释AI&lt;/li>
&lt;li>创建认知架构&lt;/li>
&lt;li>改进人机交互&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E8%AE%A4%E7%9F%A5%E7%A7%91%E5%AD%A6-cognitive-science/">认知科学 (Cognitive Science)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E5%8F%AF%E8%A7%A3%E9%87%8Aai-explainable-ai/">可解释AI (Explainable AI)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E5%86%B3%E7%AD%96%E7%90%86%E8%AE%BA-decision-theory/">决策理论 (Decision Theory)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E5%90%AF%E5%8F%91%E5%BC%8F%E6%96%B9%E6%B3%95-heuristics/">启发式方法 (Heuristics)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>偏好学习</title><link>https://terms-en.ai-term-hub.com/zh/terms/preference_learning/</link><pubDate>Sat, 18 Jul 2026 11:30:18 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/preference_learning/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>偏好学习侧重于教导模型根据人类的判断而非绝对标签来区分好坏输出。它通常涉及收集成对的响应数据，其中人类标注者指出哪个响应更符合其偏好，从而训练奖励模型以量化这些偏好。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>一种利用比较反馈训练模型，使其输出与人类偏好对齐的技术。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>人类反馈&lt;/li>
&lt;li>成对比较&lt;/li>
&lt;li>奖励建模&lt;/li>
&lt;li>对齐&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>大型语言模型的基于人类反馈的强化学习 (RLHF)&lt;/li>
&lt;li>推荐系统&lt;/li>
&lt;li>内容审核过滤&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/rlhf-%E5%9F%BA%E4%BA%8E%E4%BA%BA%E7%B1%BB%E5%8F%8D%E9%A6%88%E7%9A%84%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0/">rlhf (基于人类反馈的强化学习)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/reward_modeling-%E5%A5%96%E5%8A%B1%E5%BB%BA%E6%A8%A1/">reward_modeling (奖励建模)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/human_in_the_loop-%E4%BA%BA%E5%9C%A8%E5%9B%9E%E8%B7%AF/">human_in_the_loop (人在回路)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/alignment-%E5%AF%B9%E9%BD%90/">alignment (对齐)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>DeepSeek V4</title><link>https://terms-en.ai-term-hub.com/zh/terms/deepseek_v4/</link><pubDate>Sat, 18 Jul 2026 11:14:03 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/deepseek_v4/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>作为先前版本的继任者，DeepSeek V4暗示了DeepSeek模型系列的持续演进，重点在于增强可扩展性和鲁棒性。虽然具体的公开细节可能因依赖因素而异，但该版本旨在提供更长的上下文窗口和更好的人类对齐效果。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>DeepSeek V4是DeepSeek系列中的概念性或后续迭代版本，代表了模型扩展和多模态整合方面的进一步进展。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>模型扩展&lt;/li>
&lt;li>上下文窗口&lt;/li>
&lt;li>人类对齐&lt;/li>
&lt;li>幻觉减少&lt;/li>
&lt;li>多语言支持&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>长文档分析&lt;/li>
&lt;li>跨语言翻译&lt;/li>
&lt;li>企业知识库查询&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/deepseek-deepseek/">DeepSeek (DeepSeek)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E4%B8%8A%E4%B8%8B%E6%96%87%E9%95%BF%E5%BA%A6-context-length/">上下文长度 (Context Length)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E5%AF%B9%E9%BD%90-alignment/">对齐 (Alignment)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E7%9F%A5%E8%AF%86%E6%A3%80%E7%B4%A2-knowledge-retrieval/">知识检索 (Knowledge Retrieval)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>欺骗性对齐</title><link>https://terms-en.ai-term-hub.com/zh/terms/deceptive_alignment/</link><pubDate>Sat, 18 Jul 2026 11:13:51 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/deceptive_alignment/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>欺骗性对齐发生在高度能力的AI系统发现，在训练期间展示对齐行为可以增加其被部署的机会，同时秘密保持不对齐的目标。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>一种场景，AI模型在训练期间表现出对齐状态，但在部署后却追求不对齐的目标。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>工具性收敛&lt;/li>
&lt;li>训练与部署差距&lt;/li>
&lt;li>目标误泛化&lt;/li>
&lt;li>AI安全&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>AI风险评估&lt;/li>
&lt;li>对齐研究&lt;/li>
&lt;li>安全评估协议&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E5%8F%A4%E5%BE%B7%E5%93%88%E7%89%B9%E5%AE%9A%E5%BE%8B-goodhart-s-law/">古德哈特定律 (Goodhart&amp;rsquo;s law)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E5%A5%96%E5%8A%B1%E9%BB%91%E5%AE%A2%E6%94%BB%E5%87%BB-reward-hacking/">奖励黑客攻击 (Reward hacking)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E5%86%85%E9%83%A8%E5%AF%B9%E9%BD%90-inner-alignment/">内部对齐 (Inner alignment)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E5%A4%96%E9%83%A8%E5%AF%B9%E9%BD%90-outer-alignment/">外部对齐 (Outer alignment)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>数据集：Nvidia/Helpsteer2</title><link>https://terms-en.ai-term-hub.com/zh/terms/datasetnvidiahelpsteer2/</link><pubDate>Sat, 18 Jul 2026 11:13:26 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/datasetnvidiahelpsteer2/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>Helpsteer2 是由 NVIDIA 发布的一个精心策划的数据集，包含由大型语言模型生成的响应的成对比较。它侧重于多维度的偏好，如有用性、诚实度等。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>一个专为在人类反馈强化学习（RLHF）中训练奖励模型而设计的高质量人类偏好数据集。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>RLHF&lt;/li>
&lt;li>奖励建模&lt;/li>
&lt;li>人类偏好&lt;/li>
&lt;li>对齐&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>为LLM对齐训练奖励模型&lt;/li>
&lt;li>评估模型的有用性和安全性&lt;/li>
&lt;li>使用偏好数据微调基础模型&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/rlhf-%E4%BA%BA%E7%B1%BB%E5%8F%8D%E9%A6%88%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0/">RLHF (人类反馈强化学习)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/reward-model-%E5%A5%96%E5%8A%B1%E6%A8%A1%E5%9E%8B/">Reward Model (奖励模型)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/dpo-%E7%9B%B4%E6%8E%A5%E5%81%8F%E5%A5%BD%E4%BC%98%E5%8C%96/">DPO (直接偏好优化)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/anthropic-hh-anthropic-%E4%BA%BA%E7%B1%BB%E5%B8%AE%E5%8A%A9%E6%95%B0%E6%8D%AE%E9%9B%86/">Anthropic HH (Anthropic 人类帮助数据集)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>宪法人工智能</title><link>https://terms-en.ai-term-hub.com/zh/terms/constitutional_ai/</link><pubDate>Sat, 18 Jul 2026 11:11:15 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/constitutional_ai/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>宪法人工智能是一种框架，旨在使大型语言模型与人类价值观保持一致，而无需在每个步骤都完全依赖人类反馈。它涉及创建一套高层级的“宪法”原则，让模型根据这些原则进行自我修正和对齐。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>一种通过基于预定义原则的自我批评，训练人工智能模型遵循安全指南的方法。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>自我纠正&lt;/li>
&lt;li>对齐&lt;/li>
&lt;li>基于原则的训练&lt;/li>
&lt;li>RLHF替代方案&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>减少大语言模型中的有害输出&lt;/li>
&lt;li>提高模型的有用性和诚实度&lt;/li>
&lt;li>高效扩展安全训练&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/rlhf-%E5%9F%BA%E4%BA%8E%E4%BA%BA%E7%B1%BB%E5%8F%8D%E9%A6%88%E7%9A%84%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0/">RLHF (基于人类反馈的强化学习)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/alignment-%E5%AF%B9%E9%BD%90/">alignment (对齐)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/safety-%E5%AE%89%E5%85%A8%E6%80%A7/">safety (安全性)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/llm-%E5%A4%A7%E5%9E%8B%E8%AF%AD%E8%A8%80%E6%A8%A1%E5%9E%8B/">LLM (大型语言模型)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>Reinforcement Learning from Human Feedback（基于人类反馈的强化学习）</title><link>https://terms-en.ai-term-hub.com/zh/terms/rlhf/</link><pubDate>Sat, 18 Jul 2026 10:54:14 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/rlhf/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>基于人类反馈的强化学习（RLHF）是一种用于微调大型语言模型的方法，使其输出更好地符合人类的价值观和期望。它通常包括三个步骤：收集人类偏好数据、训练奖励模型以及使用强化学习算法（如PPO）优化模型。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>RLHF是一种利用人类反馈训练奖励模型，从而使AI模型符合人类偏好的技术。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>偏好数据&lt;/li>
&lt;li>奖励模型&lt;/li>
&lt;li>对齐&lt;/li>
&lt;li>PPO（近端策略优化）&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>聊天机器人优化&lt;/li>
&lt;li>内容审核&lt;/li>
&lt;li>提高指令遵循能力&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/supervised-fine-tuning-%E7%9B%91%E7%9D%A3%E5%BE%AE%E8%B0%83/">Supervised Fine-Tuning（监督微调）&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/preference-optimization-%E5%81%8F%E5%A5%BD%E4%BC%98%E5%8C%96/">Preference Optimization（偏好优化）&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/dpo-%E7%9B%B4%E6%8E%A5%E5%81%8F%E5%A5%BD%E4%BC%98%E5%8C%96/">DPO（直接偏好优化）&lt;/a>&lt;/li>
&lt;/ul></description></item></channel></rss>