<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Reinforcement Learning on 中文AI术语词典</title><link>https://terms-en.ai-term-hub.com/zh/tags/reinforcement-learning/</link><description>Recent content in Reinforcement Learning on 中文AI术语词典</description><generator>Hugo</generator><language>zh-cn</language><lastBuildDate>Sat, 18 Jul 2026 11:44:45 +0000</lastBuildDate><atom:link href="https://terms-en.ai-term-hub.com/zh/tags/reinforcement-learning/index.xml" rel="self" type="application/rss+xml"/><item><title>火柴盒可教井字棋引擎</title><link>https://terms-en.ai-term-hub.com/zh/terms/matchbox_educable_noughts_and_crosses_engine/</link><pubDate>Sat, 18 Jul 2026 11:25:36 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/matchbox_educable_noughts_and_crosses_engine/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>ME-Noughts-and-Crosses Engine（火柴盒可教井字棋引擎）是机器学习的早期演示，具体属于强化学习领域。该系统由304个火柴盒组成，每个盒子代表一个独特的棋盘状态，通过珠子表示动作选择，利用试错法学习获胜策略。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>由唐纳德·米奇于1961年构建的物理强化学习设备，使用火柴盒和珠子来玩井字棋。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>强化学习&lt;/li>
&lt;li>试错法&lt;/li>
&lt;li>历史AI&lt;/li>
&lt;li>井字棋&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>强化学习的教育演示&lt;/li>
&lt;li>AI历史研究&lt;/li>
&lt;li>概念化基于奖励的学习&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/reinforcement-learning-%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0/">Reinforcement learning (强化学习)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/q-learning-q%E5%AD%A6%E4%B9%A0/">Q-learning (Q学习)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/donald-michie-%E5%94%90%E7%BA%B3%E5%BE%B7-%E7%B1%B3%E5%A5%87/">Donald Michie (唐纳德·米奇)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/tic-tac-toe-ai-%E4%BA%95%E5%AD%97%E6%A3%8Bai/">Tic-Tac-Toe AI (井字棋AI)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>学习自动机</title><link>https://terms-en.ai-term-hub.com/zh/terms/learning_automaton/</link><pubDate>Sat, 18 Jul 2026 11:23:53 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/learning_automaton/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>这一概念源于强化学习，涉及智能体与未知环境的交互。自动机从有限集合中选择动作，并接收表示成功或失败的惩罚或奖励信号，从而调整其策略。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>学习自动机是一种简单的随机决策单元，它根据环境反馈迭代更新动作概率，以最大化奖励。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>动作概率向量&lt;/li>
&lt;li>奖励/惩罚信号&lt;/li>
&lt;li>随机优化&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>资源分配问题&lt;/li>
&lt;li>网络路由优化&lt;/li>
&lt;li>简单控制系统&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/reinforcement-learning-%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0/">Reinforcement learning (强化学习)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/markov-decision-process-%E9%A9%AC%E5%B0%94%E5%8F%AF%E5%A4%AB%E5%86%B3%E7%AD%96%E8%BF%87%E7%A8%8B/">Markov decision process (马尔可夫决策过程)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/q-learning-q%E5%AD%A6%E4%B9%A0/">Q-learning (Q学习)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>赋能</title><link>https://terms-en.ai-term-hub.com/zh/terms/empowerment/</link><pubDate>Sat, 18 Jul 2026 11:16:12 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/empowerment/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>在强化学习和人工智能中，赋能是一种内在动机指标，量化了智能体对其环境的控制程度。它被定义为智能体的动作与其未来状态之间的互信息，反映了智能体能够产生多少种不同的可预测结果。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>一种强化学习目标，衡量智能体通过其行为影响未来状态的能力。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>互信息&lt;/li>
&lt;li>内在动机&lt;/li>
&lt;li>控制论&lt;/li>
&lt;li>探索&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>自主机器人探索&lt;/li>
&lt;li>程序化关卡生成&lt;/li>
&lt;li>开发通用人工智能代理&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/intrinsic-motivation-%E5%86%85%E5%9C%A8%E5%8A%A8%E6%9C%BA/">Intrinsic motivation (内在动机)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/information-bottleneck-%E4%BF%A1%E6%81%AF%E7%93%B6%E9%A2%88/">Information bottleneck (信息瓶颈)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/reinforcement-learning-%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0/">Reinforcement learning (强化学习)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/curiosity-driven-learning-%E5%A5%BD%E5%A5%87%E5%BF%83%E9%A9%B1%E5%8A%A8%E5%AD%A6%E4%B9%A0/">Curiosity-driven learning (好奇心驱动学习)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>贝叶斯遗憾</title><link>https://terms-en.ai-term-hub.com/zh/terms/bayesian_regret/</link><pubDate>Sat, 18 Jul 2026 11:09:03 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/bayesian_regret/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>贝叶斯遗憾量化了在拥有完美信息时可实现的最佳奖励与智能体在不确定性下行动所获得的预期奖励之间的差异。它是通过对所有可能的世界状态进行积分计算得出的，反映了决策者在信息不完全情况下的性能损失。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>决策理论中衡量因对世界真实状态不确定而导致的预期损失的指标。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>期望效用&lt;/li>
&lt;li>先验分布&lt;/li>
&lt;li>决策理论&lt;/li>
&lt;li>遗憾最小化&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>强化学习评估&lt;/li>
&lt;li>多臂老虎机问题&lt;/li>
&lt;li>策略博弈分析&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/frequentist-regret-%E9%A2%91%E7%8E%87%E5%AD%A6%E6%B4%BE%E9%81%97%E6%86%BE/">Frequentist regret (频率学派遗憾)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/pareto-optimality-%E5%B8%95%E7%B4%AF%E6%89%98%E6%9C%80%E4%BC%98/">Pareto optimality (帕累托最优)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/expected-value-%E6%9C%9F%E6%9C%9B%E5%80%BC/">Expected value (期望值)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/information-gain-%E4%BF%A1%E6%81%AF%E5%A2%9E%E7%9B%8A/">Information gain (信息增益)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>学徒学习</title><link>https://terms-en.ai-term-hub.com/zh/terms/apprenticeship_learning/</link><pubDate>Sat, 18 Jul 2026 11:05:01 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/apprenticeship_learning/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>学徒学习，也称为基于演示的逆强化学习，使智能体能够通过观察专家行为来获取技能，而不是完全依赖奖励函数。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>一种强化学习方法，智能体通过模仿专家的演示来学习策略。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>逆强化学习&lt;/li>
&lt;li>专家演示&lt;/li>
&lt;li>策略模仿&lt;/li>
&lt;li>奖励推断&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>自动驾驶训练&lt;/li>
&lt;li>机器人操作任务&lt;/li>
&lt;li>游戏AI&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E6%A8%A1%E4%BB%BF%E5%AD%A6%E4%B9%A0-imitation-learning/">模仿学习 (Imitation Learning)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0-reinforcement-learning/">强化学习 (Reinforcement Learning)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E5%9F%BA%E4%BA%8E%E6%BC%94%E7%A4%BA%E7%9A%84%E5%AD%A6%E4%B9%A0-demonstration-based-learning/">基于演示的学习 (Demonstration-Based Learning)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E5%A5%96%E5%8A%B1%E5%A1%91%E9%80%A0-reward-shaping/">奖励塑造 (Reward Shaping)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>动作模型学习</title><link>https://terms-en.ai-term-hub.com/zh/terms/action_model_learning/</link><pubDate>Sat, 18 Jul 2026 11:04:13 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/action_model_learning/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>动作模型学习涉及智能体构建内部表示，以了解其行为如何将环境从一个状态转移到另一个状态。与被动观察不同，这种方法利用智能体自身的行动反馈来学习环境的变化规律。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>一种强化学习技术，智能体通过观察自身行为对环境产生的影响来学习环境动力学。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>状态转移&lt;/li>
&lt;li>环境动力学&lt;/li>
&lt;li>基于模型的强化学习&lt;/li>
&lt;li>预测建模&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>机器人在未知地形中的导航&lt;/li>
&lt;li>游戏人工智能学习物理引擎&lt;/li>
&lt;li>工业自动化控制系统&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/model-based-reinforcement-learning-%E5%9F%BA%E4%BA%8E%E6%A8%A1%E5%9E%8B%E7%9A%84%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0/">model-based reinforcement learning (基于模型的强化学习)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/world-models-%E4%B8%96%E7%95%8C%E6%A8%A1%E5%9E%8B/">world models (世界模型)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/dynamics-estimation-%E5%8A%A8%E5%8A%9B%E5%AD%A6%E4%BC%B0%E8%AE%A1/">dynamics estimation (动力学估计)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/planning-%E8%A7%84%E5%88%92/">planning (规划)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>演员-评论家算法</title><link>https://terms-en.ai-term-hub.com/zh/terms/actor_critic_algorithm/</link><pubDate>Sat, 18 Jul 2026 11:04:13 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/actor_critic_algorithm/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>演员-评论家算法包含两个组件：演员负责更新策略以选择动作，评论家则通过估计价值函数来评估这些动作的质量。两者协同工作，以提高强化学习的稳定性和效率。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>一种结合基于价值和基于策略方法的强化学习框架，使用两个神经网络：演员（Actor）和评论家（Critic）。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>策略梯度&lt;/li>
&lt;li>价值函数&lt;/li>
&lt;li>时序差分误差&lt;/li>
&lt;li>混合强化学习&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>机械臂操作&lt;/li>
&lt;li>游戏代理（如AlphaStar）&lt;/li>
&lt;li>自动驾驶中的连续控制系统&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/ppo-%E8%BF%91%E7%AB%AF%E7%AD%96%E7%95%A5%E4%BC%98%E5%8C%96/">PPO (近端策略优化)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/a3c-%E5%BC%82%E6%AD%A5%E4%BC%98%E5%8A%BF%E6%BC%94%E5%91%98-%E8%AF%84%E8%AE%BA%E5%AE%B6/">A3C (异步优势演员-评论家)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/policy_gradient-%E7%AD%96%E7%95%A5%E6%A2%AF%E5%BA%A6/">policy_gradient (策略梯度)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/value_function-%E4%BB%B7%E5%80%BC%E5%87%BD%E6%95%B0/">value_function (价值函数)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>引导式</title><link>https://terms-en.ai-term-hub.com/zh/terms/guided/</link><pubDate>Sat, 18 Jul 2026 10:51:52 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/guided/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>AI中的“引导式”通常指模型行为受到主要输入之外的额外信息引导的技术。常见例子包括引导扩散（guided diffusion），其中类别信息用于&amp;hellip;&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>描述受特定外部信号、约束或中间目标限制或指导的AI过程或生成方法。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>条件生成&lt;/li>
&lt;li>约束满足&lt;/li>
&lt;li>分类器引导&lt;/li>
&lt;li>分层控制&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>具有特定风格的文本到图像合成&lt;/li>
&lt;li>稀疏奖励下的强化学习&lt;/li>
&lt;li>约束优化问题&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/conditional-%E6%9D%A1%E4%BB%B6%E5%BC%8F/">Conditional (条件式)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/diffusion-%E6%89%A9%E6%95%A3/">Diffusion (扩散)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/reinforcement-learning-%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0/">Reinforcement Learning (强化学习)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/constraints-%E7%BA%A6%E6%9D%9F/">Constraints (约束)&lt;/a>&lt;/li>
&lt;/ul></description></item></channel></rss>