YANG's Blog
Index
Tags
Categories
Archives
About
Contact
Friends
YANG's Blog
Cogito, ergo sum
Index
Tags
Categories
Archives
About
Contact
Friends
Fork Me
学习笔记-强化学习
▼
学习笔记-强化学习
14
RL Chapter0 全景与起源:从 Thorndike 的猫到 DeepSeek-R1
RL Chapter1 MDP 与 Bellman 方程
RL Chapter2 动态规划 (DP):策略评估、策略迭代、价值迭代
RL Chapter3 Monte Carlo 与 TD:从样本估计价值
RL Chapter4 Q-Learning 与 SARSA:从评估到控制
RL Chapter5 Policy Gradient:直接对策略求梯度
RL Chapter6 Actor-Critic 与 GAE:Policy Gradient 的工业化
RL Chapter7 DQN 家族:深度学习接入 Q-Learning
RL Chapter8 TRPO 与 PPO:信赖域与策略梯度的工程化
RL Chapter9 DDPG 与 SAC:连续控制的两个里程碑
RL Chapter10 探索:从 ε-greedy 到 Curiosity
RL Chapter11 离线强化学习:BCQ、CQL、IQL 与 DPO 的渊源
RL Chapter12 模仿学习与逆 RL:BC、DAgger、GAIL、IRL
RL Chapter13 RL × LLM 综述:PPO、DPO、GRPO 的统一视角
YANG's Blog
/
Knowledge Base
/
学习笔记-强化学习
4 篇文章
Category
学习笔记-强化学习
按目录顺序浏览这个知识库下的文章。
RL Chapter0 全景与起源:从 Thorndike 的猫到 DeepSeek-R1
学习笔记-强化学习
2026-05-08
RL Chapter1 MDP 与 Bellman 方程
学习笔记-强化学习
2026-05-09
RL Chapter8 TRPO 与 PPO:信赖域与策略梯度的工程化
学习笔记-强化学习
2026-05-10
RL Chapter9 DDPG 与 SAC:连续控制的两个里程碑
学习笔记-强化学习
2026-05-10
2 / 2
Search