Karpathy《Deep Dive into LLMs like ChatGPT》笔记:从预训练到 RLHF 的一条主线

Karpathy 3.5 小时「LLM 完全解剖」笔记:预训练数据与 Tokenization、base model 与 post-training、幻觉与工具使用、锯齿状智能、SFT/RL/RLHF 与 DeepSeek-R1。

  • AI
  • LLM
  • Karpathy
  • RLHF
  • 课程笔记

最近花一个周末看完了 Andrej Karpathy 的《Deep Dive into LLMs like ChatGPT》—— 一支 3 小时 31 分、面向普通人的"LLM 完全解剖"。Karpathy 是 OpenAI 创始成员、 Tesla AI 前总监、Eureka Labs 创始人,这支视频是他对自己那支经典《Intro to LLMs》的全面重制, 从预训练数据一路讲到 RLHF 和 DeepSeek-R1,把 ChatGPT 背后的一整套技术栈串成了一条主线。

视频发布在 2025 年 2 月(约 3.5 小时,8 百万次播放)。原文很长, 下面是我按自己的理解整理的要点,并附上了一些个人批注。

一、预训练数据:LLM 的"互联网"养料

一切从 预训练开始:给模型喂大量的互联网文本,让它学会"接着写下去"。 这部分在视频里最关键的一点是 数据质量 > 数据数量。 高质量语料的价值远超海量垃圾文本——这也是为什么近年出现了一批精筛数据集, 比如 HuggingFace 的 FineWeb

训练的本质就是"教模型做下一个词预测",但数据选得好,模型学到的"世界知识"就扎实得多。

二、Tokenization:模型眼中的文字长什么样

Token 是模型处理文本的基本单位。Karpathy 重点强调了一个反直觉的事实: 模型并不直接"看"单词,而是看 token 序列——一个英文单词可能被切成 1–2 个 token, 而一个汉字往往对应多个 token。这带来了一系列实际后果:

  • token 数直接影响计费与速度——不同语言、不同写法,同样的内容 token 数差别巨大;
  • 模型对拼写、字母、字形的理解是"退化"的——因为它看到的是 token,不是字符;
  • 这也是为什么模型在算数、拼写上常常"翻车"——这些能力被 tokenization 抹平了。

想直观感受这一点,可以用他提到的TikToken 在线工具把任意文本拆成 token 看看。

三、神经网络 I/O:数字进来,数字出去

模型本质是一个巨大的函数:输入 token 序列的数字表示,输出下一个 token 的概率分布。 Karpathy 用 Transformer 3D 可视化来展示这些数字 如何在网络里流动,帮人建立"数字 → 内部表示 → 概率"的心智模型。

这里值得记住的是:模型内部并没有"理解"或"意图",只有一连串数学变换; 所谓的"智能",是从海量数据里统计出来的规律。

四、神经网络内部:权重即知识

网络的"知识"都藏在权重里——训练就是不断调整这些数字,让预测越来越准。 Karpathy 强调了一个关键点:知识的存取是"概率式"的。 它不像数据库那样精确地存储事实,而是以"高概率输出正确结果"的方式运行。 这既是能力所在,也是幻觉的根源。

五、推理(Inference):一次次的"下一个 token"

生成的过程就是循环推理:根据已有文本,预测下一个最可能的 token, 然后拼上去,再预测下一个……直到输出结束符。这也是为什么 LLM 有时被称为"autoregressive"(自回归)。

这个"逐 token 展开"的过程,决定了推理的延迟取决于输出长度,而不是问题复杂度。

六、GPT-2 复现与 Llama 3.1:理论与实践

为了让人看到"训练一条模型到底有多朴素",Karpathy 特意带着观众走了一遍用 llm.c 复现 GPT-2 的流程: 其实核心就是"下载数据 → 切 token → 训练 → 采样"这四步。

接着他演示了用 Llama 3.1 这类开源 base model 做推理,并借助 HyperbolicHuggingFace Playground 等平台 展示 base model 的"原始"行为——你会发现它更像一个"接着话头写下去"的机器, 而不是一个会乖乖回答问题的助手。

base model 只会"续写",不会"回答";让它变好用,靠的是后面的 post-training。

七、Post-Training:从"会说话"到"会干活"

Post-training 是把 base model 变成 ChatGPT 的关键阶段。它使用对话数据(人类标注的问答、指令对)来训练模型学会:

  • 按指令行事(不是续写,而是回答问题、完成任务);
  • 符合人类偏好(有用、无害、诚实);
  • 使用工具、查阅信息、调用 API。

这一讲也是全视频的分水岭:前面是"训练",后面是"调教成助手"。

八、幻觉、工具使用与记忆

这是最"实用"的一节。Karpathy 把模型的几个典型毛病讲得很透:

  • 幻觉——模型的本质是"接着编",当它没有足够信息时,就会自信地编出合理但不存在的答案;
  • 工具使用——让模型学会"我不知道,我去查一下",是缓解幻觉的关键手段; 搜索、计算器、数据库调用,都能把模型从"闭卷考试"变成"开卷考试";
  • 知识 vs 工作记忆——模型的知识是训练时学到的(参数量有限), 而对话里的上下文是"工作记忆"(上下文窗口)。工作记忆灵活但有限,知识固定但海量。

与其指望模型"记住"事实,不如教它"该去查时就查"——这是用 LLM 做产品的第一课。

九、自我认知与"需要 token 才能思考"

Karpathy 讲了一个深刻的现象:模型对自己的"能力边界"并没有可靠的认知—— 它不知道"这个问题我答不上来"。这是幻觉的深层原因之一。

他还强调了一个反直觉但重要的点:模型需要"用 token 来思考"。 让它一步步写出推理过程(思维链),往往比直接给答案更可靠。 这也是为什么"Let's think step by step"能显著提升效果——不是魔法, 而是给了模型"展开计算"的空间。

十、Tokenization 再探:为什么模型拼写差

回到 tokenization,Karpathy 用例子展示:因为模型看到的是 token 而非字母, 所以它对单词拼写、字母计数、反转单词这类"字符级"任务表现很差。 这是 base model 的固有弱点,跟"聪明不聪明"无关。

十一、锯齿状智能(Jagged Intelligence)

锯齿状智能是 Karpathy 近年提出的一个重要概念:模型的能力是不均匀的—— 它在某些任务上远超人类(比如总结、改写),在另一些任务上却低得离谱(比如数一个单词有几个字母)。 这种"能力曲线像锯齿"的特质,是理解和评测 LLM 时必须牢记的框架。

十二、SFT、RL 与 RLHF:让模型学会"讨喜"

Post-training 的完整链条是:

  1. 监督微调(SFT)——用人工标注的指令-回答对,让模型模仿"好的回答";InstructGPT 论文是这一阶段的里程碑;
  2. 强化学习(RL)——用奖励信号进一步优化,比如让模型在数学、代码任务上"学会用对的方法";
  3. RLHF——从人类偏好数据里训练一个"奖励模型",再反过来优化主模型,让它更符合人的口味。

这两步是 ChatGPT 与 base model 拉开差距的核心——SFT 让模型会回答,RLHF 让回答更合人心意

十三、DeepSeek-R1 与 AlphaGo:RL 的力量

Karpathy 特别讲了两个例子来说明 RL 的威力:

  • DeepSeek-R1—— 通过大量 RL 训练,让模型在数学、推理任务上自我进化出"深度思考"的能力, 证明 RL 可以显著提升推理上限;
  • AlphaGo——用 RL 学会了人类从未见过的招式(著名的"Move 37"), 是"AI 超越人类直觉"的经典例证。

RL 的核心思想是:不给标准答案,只给"对错的反馈",让模型在试错中自己找到更好的策略。

十四、保持追踪与实用入口

视频结尾,Karpathy 给出了一些"普通人也能跟上 AI 进度"的实用建议:

  • 如何追踪模型进度——用 LMArena 这类对战排行榜,而不是听厂商宣传;
  • 从哪里找到模型——开源模型可从 HuggingFace、Together 等平台直接跑;
  • 本地推理——LM Studio 这类工具可以让你在自己电脑上跑开源模型。

我的收获

  1. 一条主线贯穿全片——预训练让模型"会说话",post-training 让模型"会干活", 这就是从开源 base model 到 ChatGPT 的全部秘密。
  2. "锯齿状智能"是最好的评测心态——别笼统问"AI 强不强",要问"它在哪类任务上强、在哪类任务上弱"。
  3. 知识靠训练、实时靠检索——幻觉的工程解法不是让模型更聪明,而是教会它"查证"。
  4. RL 是下一个前沿——SFT 只能教"模仿",RL 才能教"超越",DeepSeek-R1 与 AlphaGo 都是证据。

这支视频是理解 LLM 技术栈最完整、最通俗的一份材料。 如果你也做 AI 应用,强烈建议配合我之前的Stanford CS230 笔记一起看——一支讲"原理",一支讲"工程",正好互补。 原片在 YouTube, Karpathy 还提供了配套的 Excalidraw 图解