全部栏目
斯坦福 CS329A 自我改进 AI 智能体 · 第 2 讲:测试时计算扩展
Stanford CS329A Self-Improving AI Agents | Part 2 | Test-Time Compute Scaling
SOStanford Online@stanfordonline完整字幕
中文
内容摘要:本讲量化了测试时扩展:随着并行采样数增加,解题率按幂律提升,动力来自长尾难题。课程区分了多数投票与理想验证,定义了生成-验证差距;再对比并行采样与顺序修订两种策略,引入结果奖励模型与过程奖励模型来引导搜索;最后用 Arkon 论文展示推理时架构搜索,在推理、数学与编程任务上平均提升 14.1% 的准确率。
核心要点(3条)
核心要点(3条)
- 1随着每个问题的并行采样数量不断增加,解题率会按幂律缓慢提升。
- 2生成-验证差距这个概念,衡量的是多数投票与理想验证之间的距离。
- 3过程奖励模型和结果奖励模型能让测试时搜索比盲目重采样更有效。