斯坦福 CS329A 自我改进 AI 智能体 · 第 1 讲:课程总览

Stanford CS329A Self-Improving AI Agents | Part 1 | Course Overview

SOStanford Online@stanfordonline

完整字幕

中文

内容摘要:第一讲为整门课搭好框架:先回顾从 GPT-2 到 GPT-4 的缩放定律、少样本学习与思维链推理,以及指令微调和 RLHF 如何造就 ChatGPT;再引入推理时扩展——Large Language Monkeys 用重复采样加验证器,在不重训的前提下提升准确率;最后梳理从单轮聊天机器人到提示链、路由、并行化与编排者-工作者等智能体工作流的转变。

查看原视频
核心要点(3条)

核心要点(3条)

  1. 1缩放定律把测试损失与参数量、算力和数据规模联系在一起,从 GPT-2 一路延续到 GPT-4。
  2. 2重复采样配合验证器,可以在完全不重训练的情况下提升模型准确率。
  3. 3智能体工作流由提示链、路由和编排者-工作者模式等逐步演化而来。