从 LLM 到 Agentic Workflow:一部影片看懂 Stanford AI 系统课程

把斯坦福 CS230《Beyond LLM》浓缩成一张 AI Builder 技术地图:base model 的限制、三大增强工具、Agentic Workflow 与 Multi-Agent。

  • AI
  • Stanford
  • Agent
  • LLM
  • RAG
  • 课程笔记

最近花 27 分钟看完了 Gary Chen 的这部视频, 它把斯坦福 CS230(2025 秋)的《Beyond LLM》一讲浓缩成了一支「AI Builder 技术地图」。 从 base model 的限制讲起,一路到 Prompt Engineering、Fine-Tuning、RAG、 Agentic Workflow 与 Multi-Agent——每层技术解什么痛点、什么时候该用,看完心里就有数了。

原文课程(约 2 小时)在 斯坦福官方频道, 下面是我按自己的理解重写的要点,加了一些个人批注。

一、LLM 的限制与「纵轴思维」

课程开篇先立了一个框架:base model 本身是有边界的。它不知道私有数据、 容易幻觉、不能保证实时更新、也不擅长数学。所以与其纠结"换更大的模型", 不如建立纵轴思维——在横轴(模型尺寸)之外, 用工程手段沿着纵轴把模型的能力"撑起来"。

这不是在骂 base model 弱,而是说:模型的能力上限,由你给它搭的"脚手架"决定。

横轴 · 更好的 base modelGPT-3.5GPT-4GPT-4oGPT-5 …纵轴 · 工程增强Multi-Agent 系统分工 + 并行Agentic Workflow多步 + 工具RAG · 检索增强外部知识Prompt Engineering最便宜的一层同一个模型能有多强,取决于纵轴"纵轴思维":别急着换模型,先看看模型外面还能加什么
图 1 · 纵轴思维:同一个模型能有多强,取决于你在纵轴上给它搭的脚手架(进入视口时逐层亮起)

二、强化单一 LLM 的三大工具

  • Prompt Engineering——最便宜的手段。零成本、见效快,但能力天花板低,适合原型验证。
  • Fine-Tuning——改变模型行为本身。当你想让它学会一种"风格"或"领域口吻"时用它,比 prompt 更持久。
  • RAG(检索增强)——给模型接上外部知识。解决私有数据、时效性、幻觉问题,是目前工程上最通用的手段。

三者不是互斥的,而是可以叠加:先用 prompt 调优到极限,再决定要不要 fine-tune; 只要涉及领域知识,RAG 几乎是必选项。

三、Agentic Workflow 的系统设计

当单次 LLM 调用不够时,就进入 Agentic Workflow:把一个大任务拆成多个步骤, 让模型在循环里"思考—行动—观察"。课程强调系统设计层面的几个关键问题:

  • 任务分解:怎么把目标拆成可执行的子任务;
  • 工具调用:模型如何决定调用哪个工具、传入什么参数;
  • 记忆与状态:跨步骤的上下文如何保留;
  • 反馈回路:拿到工具结果后如何修正下一步。
Vanilla · 一问一答用户"我能退款吗?"RAG 回答"30 天内可退"Agentic Workflow · 多步 + 工具1 · 理解意图提取订单号2 · 查退换政策RAG / 检索3 · 调 API 核验订单状态 / 资格4 · 组织回复"您的订单符合退款条件,3-5 个工作日到账。"5 · 记忆更新记录偏好 · 下次更快反馈 · 修正
图 2 · 客服 Agent 示例:从一问一答到理解意图 → 查政策 → 调 API → 组织回复 → 更新记忆的多步流程

四、评估系统与客服 Agent 实作

课程里用了一个很接地气的例子:客服 Agent。它的价值在于展示了完整的工程闭环—— 光有 Agent 循环还不够,你要有评估集来衡量每次改动是变好还是变坏。 没有评估的 Agent 系统,就像没有测试的代码库,迟早会悄悄退化。

五、Multi-Agent 与学习路线

最后一节讲 Multi-Agent:多个专用 Agent 分工协作,而不是一个全能 Agent 硬扛所有事。 但课程也泼了冷水——Multi-Agent 带来的是协调复杂度,只有当任务真的需要分工时才有必要。

学习路线大致是:先把 Prompt 用好 → 掌握 RAG → 上手单 Agent → 再考虑 Multi-Agent。每一步都有清晰的"什么时候该上"的判断标准, 这也是这门课最值钱的地方。

我的几点体会

  1. "纵轴思维"是整部影片的题眼。很多人面对模型能力不足,第一反应是"换个更大的模型",但工程上的杠杆往往在模型之外的系统里。
  2. RAG 是当前最通用的第一性方案。它把"模型不知道的事"变成"模型可检索的事",是最接近工程本质的解法。
  3. 评估先于优化。客服 Agent 的例子提醒我:迭代之前先想清楚怎么衡量成功,否则改进都是盲目的。

如果你也在学 Agent,这部 27 分钟的浓缩版是个不错的入口; 想深入的话,直接看斯坦福原课。