全部栏目
斯坦福 CS329A 自我改进 AI 智能体 · 第 7 讲:自我改进与深度研究智能体
Stanford CS329A Self-Improving AI Agents | Part 7 | Self-Improvement and Deep Research Agents
SOStanford Online@stanfordonline完整字幕
中文
内容摘要:AlphaCode 依靠海量采样与聚类选择打进编程竞赛前列,AlphaCode2 用学习到的评分模型微调 Gemini Pro 后冲到第 85 百分位。Search-O1 把同样的思路带进深度研究:在推理模型表达不确定的地方触发检索查询,再围绕检索到的文档推理,在 GPQA 与多跳问答基准上超过标准 RAG 与智能体式 RAG。
核心要点(3条)
核心要点(3条)
- 1解题率会随着采样预算的增大而提升,但选择与聚类最先成为瓶颈。
- 2Search-O1 的做法是只在推理模型表达出不确定性的位置触发检索。
- 3基于提示的 Search-O1 与基于强化学习的 Search-R1 各有取舍。