AnchorAI › Reinforcement Learning
Reinforcement Learning
强化学习
一句话理解
强化学习让智能体根据行动带来的奖励,学习获得更高长期累计回报的策略。
根据行动后果,学习长期更划算的做法。
最好理解的例子
在倒立摆任务中,小车选择向左或向右移动;杆子保持平衡越久,累计奖励越高,训练使小车逐渐学会维持平衡。
核心机制
- 1
通过交互或已有记录取得状态、动作、奖励和后继状态。
- 2
依据这些经验估计动作或策略的长期累计回报。
- 3
更新策略或价值函数,改善动作选择。
- 4
使用更多经验继续训练,并评估策略表现。
相关术语
关键关系
快速对比
监督学习通常提供目标答案;强化学习提供行动结果的奖励,某个动作的价值可能要经过多步才显现。
常见误解
奖励不等于每一步都有标准动作答案。强化学习也不一定需要世界模型,既有基于模型的方法,也有不显式学习环境模型的方法。
知识邻域
AI → Reinforcement Learning