斯坦福 CS329A 自我改进 AI 智能体 · 第 6 讲:训练时扩展与 RL 扩展

Stanford CS329A Self-Improving AI Agents | Part 6 | Train Time Scaling/Scaling RL

SOStanford Online@stanfordonline

完整字幕

中文

内容摘要:三篇论文构成训练时扩展的主线:STaR 通过合理化与按答案正确性过滤来自举推理链;DeepSeekMath 提出 GRPO,用更省显存的组内相对优势估计替代 PPO;DAPO 用非对称裁剪与动态采样解决长思维链强化学习中的熵坍缩。沿着 AIME 数学基准看,这些方法让更小的模型开始追平大得多的系统。

查看原视频
核心要点(3条)

核心要点(3条)

  1. 1STaR 对做错的题目做合理化反推,再把正确的推理链加回训练集。
  2. 2GRPO 用组内相对优势替代 PPO 的价值网络,大幅降低内存开销。
  3. 3DAPO 用非对称裁剪和动态采样,治住了长思维链强化学习的熵坍缩。