NOTES / SERIES
RL Mathematics
连载中CS285 强化学习的数学基础:从 MDP 与 Bellman 方程到策略梯度、Model-Based 与离线 RL。
9 章 · ≈ 28MIN · 前置:概率论基础
01 RL 数学 Note 1:值函数与贝尔曼期望方程 在有限折扣 MDP 中建立值函数、贝尔曼期望方程及其矩阵与算子视角。 5 MIN 02 RL 数学 Note 2:贝尔曼最优方程、值迭代与策略迭代 从最优贝尔曼方程出发,推导值迭代、策略迭代及其收敛性。 4 MIN 03 RL 数学 Note 4:随机近似、TD 与 Q-learning 从随机近似出发,统一理解增量学习、TD(0)、SARSA 与 Q-learning 的收敛骨架。 6 MIN 04 RL 数学 Note 5:策略梯度、Baseline 与 Off-Policy 从轨迹分布出发推导策略梯度,并统一理解 baseline、reward-to-go 与 off-policy 校正。 6 MIN 05 RL 数学 Note 6:序列决策与大语言模型的强化学习 从 IRL 回顾出发,讲解 Transformer、LLM 预训练与后训练、RLHF、PPO、GRPO 与验证器。 2 MIN 06 RL 数学 Note 7:基于模型的强化学习 学习环境模拟器的可行性、分布偏移、信任区域、悲观主义与探索,以及贝叶斯与 Bootstrap 不确定性。 2 MIN 07 RL 数学 Note 8:基于模型的强化学习算法 开环与闭环规划、随机打靶与 CEM、Dyna、潜空间状态模型与 Actor-Critic + 模型。 1 MIN 08 RL 数学 Note 9:离线强化学习 Offline RL 的定义、分布偏移挑战、策略约束与保守方法。 1 MIN 09 RL 数学 Note 10:离线强化学习算法 AWR、AWAC、IQL、CQL 等离线 RL 算法,以及从离线到在线的迁移。 1 MIN