全部栏目
斯坦福 CS329A 自我改进 AI 智能体 · 第 1 讲:课程总览
Stanford CS329A Self-Improving AI Agents | Part 1 | Course Overview
SOStanford Online@stanfordonline完整字幕
中文
内容摘要:第一讲为整门课搭好框架:先回顾从 GPT-2 到 GPT-4 的缩放定律、少样本学习与思维链推理,以及指令微调和 RLHF 如何造就 ChatGPT;再引入推理时扩展——Large Language Monkeys 用重复采样加验证器,在不重训的前提下提升准确率;最后梳理从单轮聊天机器人到提示链、路由、并行化与编排者-工作者等智能体工作流的转变。
核心要点(3条)
核心要点(3条)
- 1缩放定律把测试损失与参数量、算力和数据规模联系在一起,从 GPT-2 一路延续到 GPT-4。
- 2重复采样配合验证器,可以在完全不重训练的情况下提升模型准确率。
- 3智能体工作流由提示链、路由和编排者-工作者模式等逐步演化而来。