<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>RL on 中文AI术语词典</title><link>https://terms-en.ai-term-hub.com/zh/tags/rl/</link><description>Recent content in RL on 中文AI术语词典</description><generator>Hugo</generator><language>zh-cn</language><lastBuildDate>Sat, 18 Jul 2026 11:44:45 +0000</lastBuildDate><atom:link href="https://terms-en.ai-term-hub.com/zh/tags/rl/index.xml" rel="self" type="application/rss+xml"/><item><title>动作选择中的赢家通吃机制</title><link>https://terms-en.ai-term-hub.com/zh/terms/winner_take_all_in_action_selection/</link><pubDate>Sat, 18 Jul 2026 11:38:14 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/winner_take_all_in_action_selection/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>赢家通吃 (WTA) 是一种用于神经网络和强化学习中的竞争过程，用于解决多个竞争动作或假设之间的冲突。在此方案中，激活值最高的单元获胜并执行动作，同时抑制其他竞争者。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>一种决策机制，其中激活水平最高的神经元或代理抑制其他所有单元，从而选择一个单一的动作。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>侧向抑制&lt;/li>
&lt;li>竞争性学习&lt;/li>
&lt;li>动作选择&lt;/li>
&lt;li>排他性选择&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>运动控制系统&lt;/li>
&lt;li>分类任务&lt;/li>
&lt;li>强化学习智能体&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/softmax-%E5%87%BD%E6%95%B0-softmax-function/">Softmax 函数 (Softmax function)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E7%8E%BB%E5%B0%94%E5%85%B9%E6%9B%BC%E6%9C%BA-boltzmann-machine/">玻尔兹曼机 (Boltzmann machine)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0-reinforcement-learning/">强化学习 (Reinforcement learning)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E7%A5%9E%E7%BB%8F%E7%AB%9E%E4%BA%89-neural-competition/">神经竞争 (Neural competition)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>三因子学习</title><link>https://terms-en.ai-term-hub.com/zh/terms/three_factor_learning/</link><pubDate>Sat, 18 Jul 2026 11:36:49 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/three_factor_learning/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>三因子学习是强化学习中的一种特定方法，它将学习过程分解为三个不同的组成部分：奖励信号、价值函数和策略。奖励信号提供即时反馈，价值函数评估长期预期收益，而策略则决定智能体的行动选择。这种分解有助于更精细地调整和优化智能体在复杂环境中的行为表现。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>一种利用奖励、价值和策略因子来优化智能体行为的强化学习框架。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>奖励信号&lt;/li>
&lt;li>价值函数&lt;/li>
&lt;li>策略优化&lt;/li>
&lt;li>强化学习&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>游戏智能体&lt;/li>
&lt;li>机器人控制&lt;/li>
&lt;li>资源管理&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/reinforcement-learning-%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0/">Reinforcement Learning (强化学习)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/q-learning-q%E5%AD%A6%E4%B9%A0/">Q-Learning (Q学习)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/policy-gradient-%E7%AD%96%E7%95%A5%E6%A2%AF%E5%BA%A6/">Policy Gradient (策略梯度)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/reward-shaping-%E5%A5%96%E5%8A%B1%E5%A1%91%E9%80%A0/">Reward Shaping (奖励塑造)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>机器人学习</title><link>https://terms-en.ai-term-hub.com/zh/terms/robot_learning/</link><pubDate>Sat, 18 Jul 2026 11:32:26 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/robot_learning/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>机器人学习涉及利用机器学习技术训练机器人代理自主执行任务。与预编程行为不同，这些系统能够适应动态环境，从而提升其在复杂场景中的表现。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>机器人学的一个分支领域，专注于使机器人能够通过经验和与环境互动来获取技能并提高性能。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>强化学习&lt;/li>
&lt;li>模仿学习&lt;/li>
&lt;li>仿真到现实迁移&lt;/li>
&lt;li>运动控制&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>自动化仓库拣选&lt;/li>
&lt;li>人形机器人步态适应&lt;/li>
&lt;li>机器人手术辅助&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/reinforcement_learning-%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0/">reinforcement_learning (强化学习)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/imitation_learning-%E6%A8%A1%E4%BB%BF%E5%AD%A6%E4%B9%A0/">imitation_learning (模仿学习)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/sim2real-%E4%BB%BF%E7%9C%9F%E5%88%B0%E7%8E%B0%E5%AE%9E/">sim2real (仿真到现实)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/motor_skills-%E8%BF%90%E5%8A%A8%E6%8A%80%E8%83%BD/">motor_skills (运动技能)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>概率匹配</title><link>https://terms-en.ai-term-hub.com/zh/terms/probability_matching/</link><pubDate>Sat, 18 Jul 2026 11:30:38 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/probability_matching/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>概率匹配是一种在强化学习和心理学中经常观察到的行为模式，与最优的“最大化”策略形成对比。它并不总是选择概率最高的动作，而是根据各动作的概率分布来随机选择动作。这种策略虽然不如贪婪策略在静态环境中高效，但在非平稳环境或需要探索的场景中可能更具鲁棒性。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>一种决策策略，智能体选择动作的频率与其估计的概率成正比。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>探索与利用&lt;/li>
&lt;li>强化学习&lt;/li>
&lt;li>随机环境&lt;/li>
&lt;li>决策理论&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>在心理学实验中模拟人类行为&lt;/li>
&lt;li>在非平稳多臂老虎机问题中进行稳健探索&lt;/li>
&lt;li>分析次优学习算法&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/epsilon-greedy-%CE%B5-%E8%B4%AA%E5%A9%AA%E7%AD%96%E7%95%A5/">epsilon-greedy (ε-贪婪策略)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/softmax_action_selection-softmax%E5%8A%A8%E4%BD%9C%E9%80%89%E6%8B%A9/">softmax_action_selection (Softmax动作选择)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/maximizing_strategy-%E6%9C%80%E5%A4%A7%E5%8C%96%E7%AD%96%E7%95%A5/">maximizing_strategy (最大化策略)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/exploration_bonus-%E6%8E%A2%E7%B4%A2%E5%A5%96%E5%8A%B1/">exploration_bonus (探索奖励)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>预测状态表示</title><link>https://terms-en.ai-term-hub.com/zh/terms/predictive_state_representation/</link><pubDate>Sat, 18 Jul 2026 11:30:18 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/predictive_state_representation/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>预测状态表示（PSR）扩展了传统的部分可观察马尔可夫决策过程，将状态定义为关于未来可观察事件的预测向量集合。它不依赖于无法直接观测的隐藏状态，而是利用历史动作和观测序列来构建对未来的预测。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>强化学习中的一种潜在状态形式化方法，基于动作历史预测未来的观测结果。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>部分可观察性&lt;/li>
&lt;li>未来预测&lt;/li>
&lt;li>基于历史的状态&lt;/li>
&lt;li>强化学习&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>杂乱环境中的机器人控制&lt;/li>
&lt;li>具有隐藏信息的博弈AI&lt;/li>
&lt;li>金融市场预测&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/partially_observable_mdp-%E9%83%A8%E5%88%86%E5%8F%AF%E8%A7%82%E5%AF%9F%E9%A9%AC%E5%B0%94%E5%8F%AF%E5%A4%AB%E5%86%B3%E7%AD%96%E8%BF%87%E7%A8%8B/">partially_observable_mdp (部分可观察马尔可夫决策过程)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/latent_space-%E6%BD%9C%E5%9C%A8%E7%A9%BA%E9%97%B4/">latent_space (潜在空间)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/state_estimation-%E7%8A%B6%E6%80%81%E4%BC%B0%E8%AE%A1/">state_estimation (状态估计)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/pomdp-%E9%83%A8%E5%88%86%E5%8F%AF%E8%A7%82%E5%AF%9F%E9%A9%AC%E5%B0%94%E5%8F%AF%E5%A4%AB%E5%86%B3%E7%AD%96%E8%BF%87%E7%A8%8B/">pomdp (部分可观察马尔可夫决策过程)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>多臂老虎机</title><link>https://terms-en.ai-term-hub.com/zh/terms/multi_armed_bandit/</link><pubDate>Sat, 18 Jul 2026 11:26:49 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/multi_armed_bandit/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>多臂老虎机问题说明了智能体面临的困境：是坚持使用已知的奖励选项（利用），还是尝试新选项以发现可能带来更高奖励的策略。该问题旨在优化长期累积奖励。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>多臂老虎机是概率论和强化学习中的一个经典问题，用于模拟探索与利用之间的权衡。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>探索与利用的权衡&lt;/li>
&lt;li>奖励最大化&lt;/li>
&lt;li>随机过程&lt;/li>
&lt;li>遗憾最小化&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>A/B测试优化&lt;/li>
&lt;li>推荐系统&lt;/li>
&lt;li>广告展示策略&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/reinforcement-learning-%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0/">Reinforcement Learning (强化学习)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/epsilon-greedy-%CE%B5-%E8%B4%AA%E5%BF%83%E7%AE%97%E6%B3%95/">Epsilon-Greedy (ε-贪心算法)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/contextual-bandits-%E4%B8%8A%E4%B8%8B%E6%96%87%E8%80%81%E8%99%8E%E6%9C%BA/">Contextual Bandits (上下文老虎机)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/optimization-%E4%BC%98%E5%8C%96/">Optimization (优化)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>登山车问题</title><link>https://terms-en.ai-term-hub.com/zh/terms/mountain_car_problem/</link><pubDate>Sat, 18 Jul 2026 11:26:37 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/mountain_car_problem/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>登山车问题是强化学习研究中的标准基准。目标是将一辆动力不足的车控制到陡坡顶部。由于车辆无法直接爬上山坡，智能体需要利用惯性来回摆动以积累动能。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>一个经典强化学习任务，智能体必须仅使用加速控制将车开上陡峭的山坡。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>稀疏奖励&lt;/li>
&lt;li>延迟后果&lt;/li>
&lt;li>连续控制&lt;/li>
&lt;li>基准测试&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>测试新的强化学习算法&lt;/li>
&lt;li>展示价值函数近似技术&lt;/li>
&lt;li>强化学习概念的教学示例&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/openai-gym-openai-%E7%8E%AF%E5%A2%83%E5%BA%93/">OpenAI Gym (OpenAI 环境库)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0-reinforcement-learning/">强化学习 (Reinforcement Learning)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E5%8D%95%E6%91%86%E4%B8%8A%E6%91%86-pendulum-swing-up/">单摆上摆 (Pendulum Swing-Up)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E5%80%BC%E8%BF%AD%E4%BB%A3-value-iteration/">值迭代 (Value Iteration)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>内在动机</title><link>https://terms-en.ai-term-hub.com/zh/terms/intrinsic_motivation/</link><pubDate>Sat, 18 Jul 2026 11:22:43 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/intrinsic_motivation/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>在强化学习中，内在动机驱使智能体通过寻求新颖性、减少不确定性或掌握技能来探索其环境，而不依赖于外在的任务奖励。这种机&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>强化学习中的一个概念，指智能体基于内部好奇心或知识获取而非外部奖励来追求目标。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>强化学习&lt;/li>
&lt;li>探索与利用&lt;/li>
&lt;li>好奇心驱动学习&lt;/li>
&lt;li>稀疏奖励&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>未知地形中的机器人导航&lt;/li>
&lt;li>游戏智能体发现策略&lt;/li>
&lt;li>自动驾驶汽车训练&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/reinforcement-learning-%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0/">Reinforcement Learning (强化学习)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/reward-shaping-%E5%A5%96%E5%8A%B1%E5%A1%91%E9%80%A0/">Reward Shaping (奖励塑造)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/curiosity-module-%E5%A5%BD%E5%A5%87%E5%BF%83%E6%A8%A1%E5%9D%97/">Curiosity Module (好奇心模块)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/exploration-strategy-%E6%8E%A2%E7%B4%A2%E7%AD%96%E7%95%A5/">Exploration Strategy (探索策略)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>探索-利用困境</title><link>https://terms-en.ai-term-hub.com/zh/terms/explorationexploitation_dilemma/</link><pubDate>Sat, 18 Jul 2026 11:16:49 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/explorationexploitation_dilemma/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>在决策过程中，智能体面临权衡：它们可以利用当前知识获得最佳即时奖励，或者探索未知选项以潜在地找到更好的长期策略。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>探索-利用困境是强化学习中的一个基本问题，智能体必须在探索新动作以收集信息和利用已知动作以最大化奖励之间做出选择。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>奖励最大化&lt;/li>
&lt;li>ε-贪婪算法&lt;/li>
&lt;li>上置信界&lt;/li>
&lt;li>强化学习&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>推荐系统决定是否建议热门商品还是新商品&lt;/li>
&lt;li>营销活动中的A/B测试&lt;/li>
&lt;li>动态环境中的资源分配&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0/">强化学习&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E5%A4%9A%E8%87%82%E8%80%81%E8%99%8E%E6%9C%BA/">多臂老虎机&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/q%E5%AD%A6%E4%B9%A0/">Q学习&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E7%AD%96%E7%95%A5%E6%A2%AF%E5%BA%A6/">策略梯度&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>在线策略</title><link>https://terms-en.ai-term-hub.com/zh/terms/on_policy/</link><pubDate>Sat, 18 Jul 2026 10:56:59 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/on_policy/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>在线策略算法要求智能体直接从其当前策略所采取的动作中学习。这意味着在探索过程中收集的数据被立即用于更新策略，从而确保数据分布的一致性。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>一种强化学习方法，其中被评估和改进的策略与用于生成数据的策略相同。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>强化学习&lt;/li>
&lt;li>策略梯度&lt;/li>
&lt;li>数据一致性&lt;/li>
&lt;li>样本效率&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>具有安全约束的机器人控制&lt;/li>
&lt;li>需要精确更新的博弈代理&lt;/li>
&lt;li>实时自适应系统&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/off-policy-%E7%A6%BB%E7%BA%BF%E7%AD%96%E7%95%A5/">off-policy (离线策略)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/reinforce-reinforce%E7%AE%97%E6%B3%95/">REINFORCE (REINFORCE算法)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/ppo-%E8%BF%91%E7%AB%AF%E7%AD%96%E7%95%A5%E4%BC%98%E5%8C%96/">PPO (近端策略优化)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/actor-critic-%E6%BC%94%E5%91%98-%E8%AF%84%E8%AE%BA%E5%AE%B6%E6%9E%B6%E6%9E%84/">actor-critic (演员-评论家架构)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>长视界</title><link>https://terms-en.ai-term-hub.com/zh/terms/long_horizon/</link><pubDate>Sat, 18 Jul 2026 10:56:47 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/long_horizon/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>长视界问题涉及一系列动作，其中早期决策的影响仅在许多步骤后才显现。这在机器人技术、规划和多步推理任务中很常见。挑战&amp;hellip;&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>指需要在较长时间范围内进行决策，且奖励或后果延迟的任务。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>时间依赖性&lt;/li>
&lt;li>信用分配&lt;/li>
&lt;li>延迟奖励&lt;/li>
&lt;li>序列决策&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>机器人操作任务&lt;/li>
&lt;li>多步金融交易&lt;/li>
&lt;li>战略游戏规划&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/reinforcement_learning-%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0/">reinforcement_learning (强化学习)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/temporal_difference-%E6%97%B6%E5%BA%8F%E5%B7%AE%E5%88%86/">temporal_difference (时序差分)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/planning-%E8%A7%84%E5%88%92/">planning (规划)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>状态</title><link>https://terms-en.ai-term-hub.com/zh/terms/state/</link><pubDate>Sat, 18 Jul 2026 10:55:02 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/state/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>状态代表了在马尔可夫决策过程（MDP）等系统中确定未来行为所需的所有相关信息。在强化学习中，状态封装了环境的当前情况。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>系统在特定时刻的完整配置。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>配置&lt;/li>
&lt;li>时间步&lt;/li>
&lt;li>观测&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>强化学习智能体&lt;/li>
&lt;li>隐马尔可夫模型&lt;/li>
&lt;li>系统监控&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E5%8A%A8%E4%BD%9C-action/">动作 (Action)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E5%A5%96%E5%8A%B1-reward/">奖励 (Reward)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E8%BD%AC%E7%A7%BB-transition/">转移 (Transition)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>策略</title><link>https://terms-en.ai-term-hub.com/zh/terms/policy/</link><pubDate>Sat, 18 Jul 2026 10:53:51 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/policy/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>“策略”一词根据上下文具有双重含义。在一般管理中，它是决策的指导原则。在强化学习（RL）中，策略是智能体的核心组成部分，它定义了智能体在特定状态下应采取的动作概率分布或确定性动作。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>旨在指导决策并实现理性结果的战略或行动计划，常用于强化学习中将状态映射到动作。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>决策制定&lt;/li>
&lt;li>强化学习&lt;/li>
&lt;li>状态-动作映射&lt;/li>
&lt;li>优化&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>通过强化学习训练自主机器人&lt;/li>
&lt;li>为自动化审批创建业务规则&lt;/li>
&lt;li>开发游戏AI代理&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/agent-%E6%99%BA%E8%83%BD%E4%BD%93/">Agent (智能体)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/reward-%E5%A5%96%E5%8A%B1/">Reward (奖励)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/strategy-%E6%88%98%E7%95%A5/">Strategy (战略)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/algorithm-%E7%AE%97%E6%B3%95/">Algorithm (算法)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>分层</title><link>https://terms-en.ai-term-hub.com/zh/terms/hierarchical/</link><pubDate>Sat, 18 Jul 2026 10:51:52 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/hierarchical/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>分层AI系统将信息或控制组织成嵌套层的树状结构。在强化学习中，分层强化学习（Hierarchical RL）将复杂任务分解为由高层管理的子目标&amp;hellip;&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>指组织为多个抽象级别的AI架构或学习策略，高级别控制低级别。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>抽象层级&lt;/li>
&lt;li>子目标设定&lt;/li>
&lt;li>特征提取&lt;/li>
&lt;li>模块化&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>复杂机器人任务分解&lt;/li>
&lt;li>深度神经网络特征学习&lt;/li>
&lt;li>带有语法树的自然语言处理&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/reinforcement-learning-%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0/">Reinforcement Learning (强化学习)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/abstraction-%E6%8A%BD%E8%B1%A1/">Abstraction (抽象)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/multi-agent-systems-%E5%A4%9A%E6%99%BA%E8%83%BD%E4%BD%93%E7%B3%BB%E7%BB%9F/">Multi-agent Systems (多智能体系统)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/tree-search-%E6%A0%91%E6%90%9C%E7%B4%A2/">Tree Search (树搜索)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>动作</title><link>https://terms-en.ai-term-hub.com/zh/terms/action/</link><pubDate>Sat, 18 Jul 2026 10:49:06 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/action/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>在人工智能和机器人技术中，动作是指智能体为与环境交互而采取的具体步骤或决策。动作是基于当前状态选择的。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>智能体为影响其环境而执行的操作。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>智能体&lt;/li>
&lt;li>环境&lt;/li>
&lt;li>策略&lt;/li>
&lt;li>状态转移&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>强化学习&lt;/li>
&lt;li>机器人控制&lt;/li>
&lt;li>博弈AI&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/observation-%E8%A7%82%E6%B5%8B/">Observation (观测)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/reward-%E5%A5%96%E5%8A%B1/">Reward (奖励)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/policy-%E7%AD%96%E7%95%A5/">Policy (策略)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/state-%E7%8A%B6%E6%80%81/">State (状态)&lt;/a>&lt;/li>
&lt;/ul></description></item></channel></rss>