JASONATLAS

搜索 Jason Atlas

搜索缩写、中英文名称、别名与关键词

AnchorAI › Reinforcement Learning

Reinforcement Learning

强化学习

一句话理解

强化学习让智能体根据行动带来的奖励,学习获得更高长期累计回报的策略。

根据行动后果,学习长期更划算的做法。

最好理解的例子

在倒立摆任务中,小车选择向左或向右移动;杆子保持平衡越久,累计奖励越高,训练使小车逐渐学会维持平衡。

核心机制

  1. 1

    通过交互或已有记录取得状态、动作、奖励和后继状态。

  2. 2

    依据这些经验估计动作或策略的长期累计回报。

  3. 3

    更新策略或价值函数,改善动作选择。

  4. 4

    使用更多经验继续训练,并评估策略表现。

相关术语

关键关系

快速对比

监督学习通常提供目标答案;强化学习提供行动结果的奖励,某个动作的价值可能要经过多步才显现。

常见误解

奖励不等于每一步都有标准动作答案。强化学习也不一定需要世界模型,既有基于模型的方法,也有不显式学习环境模型的方法。

知识邻域

AI → Reinforcement Learning