斯坦福 CS329A 自我改进 AI 智能体 · 第 8 讲:智能体评测与长程任务

Stanford CS329A Self-Improving AI Agents | Part 8 | Agentic Evaluations and Long Horizon Tasks

SOStanford Online@stanfordonline

完整字幕

中文

内容摘要:METR 的时程方法论测量模型在 50% 与 80% 可靠性下能完成的任务时长,从 2019 年的秒级涨到 2025 年 Claude 3.7 Sonnet 的近一小时,约每七个月翻倍。OpenAI 的 GDPval 在 44 个职业上让模型对比行业专家的作品,斯坦福 Deep Scholar Bench 则考察文献综述的引用可验证性,最后总结了智能体的典型失败模式。

查看原视频
核心要点(3条)

核心要点(3条)

  1. 1METR 的测量结果表明,模型可完成的任务时长约每七个月翻一倍。
  2. 2在 GDPval 上,模型对行业专家的胜率从 12.4% 涨到 47.6%。
  3. 3智能体典型的失败模式:规划差、选错工具、过早放弃、动作循环。