全部栏目
斯坦福 CS329A 自我改进 AI 智能体 · 第 5 讲:规划与多步推理
Stanford CS329A Self-Improving AI Agents | Part 5 | Planning and Multi-Step Reasoning
SOStanford Online@stanfordonline完整字幕
中文
内容摘要:三篇规划论文各解一难:LATS 把蒙特卡洛树搜索搬进语言智能体,用 LLM 裁判与自一致性打分,在 HotpotQA 和 WebShop 上测试;SPRINT 微调 DeepSeek-R1 生成相互独立的并行计划,降低顺序 token 数的同时提升数学与 GPQA 准确率;SWiRL 用离线合成的多步工具调用轨迹做多步强化学习,训练期完全不执行工具。
核心要点(3条)
核心要点(3条)
- 1LATS 用蒙特卡洛树搜索结合 LLM 裁判打分,统一了推理、行动与搜索。
- 2SPRINT 让模型生成相互独立的计划并行执行,砍掉了顺序生成的 token 开销。
- 3SWiRL 在离线合成轨迹上训练,全程不需要真的执行任何工具调用。