斯坦福 CS329A 自我改进 AI 智能体 · 第 7 讲:自我改进与深度研究智能体

Stanford CS329A Self-Improving AI Agents | Part 7 | Self-Improvement and Deep Research Agents

SOStanford Online@stanfordonline

完整字幕

中文

内容摘要:AlphaCode 依靠海量采样与聚类选择打进编程竞赛前列,AlphaCode2 用学习到的评分模型微调 Gemini Pro 后冲到第 85 百分位。Search-O1 把同样的思路带进深度研究:在推理模型表达不确定的地方触发检索查询,再围绕检索到的文档推理,在 GPQA 与多跳问答基准上超过标准 RAG 与智能体式 RAG。

查看原视频
核心要点(3条)

核心要点(3条)

  1. 1解题率会随着采样预算的增大而提升,但选择与聚类最先成为瓶颈。
  2. 2Search-O1 的做法是只在推理模型表达出不确定性的位置触发检索。
  3. 3基于提示的 Search-O1 与基于强化学习的 Search-R1 各有取舍。