IV
VOLUME IV

大语言模型

彻底引爆 AI 革命:从注意力到 ChatGPT

2017 年,一篇横空出世的论文喊出“注意力就是一切”,彻底颠覆了整个人工智能领域!在这一卷,我们将亲手拆解现代大模型的完整秘密:让词与词自由沟通的注意力、宏伟的 Transformer 架构、千亿级参数的大规模预训练,以及让人工智能学会听懂人话、安全对齐的秘密技巧。

开始第一课 →
整套课程 · 五部分,一条路
卷一基础数学把万物化为数字
卷二神经网络让机器学会思考
卷三自然语言处理让机器听懂人话
卷四 · 你在这里大语言模型蜕变成超级智能
卷五附录3D全景与原典
这一卷的故事

《Attention Is All You Need》的核心主张极其简单:不需要循环,让每个词同时「查询」所有其他词。这个操作完全可以并行,让 GPU 的成千上万个核心第一次能被充分利用。参数量从亿级突破到千亿、万亿——规模本身就是一种能力,这是研究者在之前几十年都没有预料到的。

一个 Transformer Block = 多头注意力(多种关系同时建模)+ FFN(逐位置深加工)+ 残差连接(梯度高速公路)+ LayerNorm(数值稳定)。把它叠 96 层,配上合适的分词器和位置编码,就是 GPT-3 的主体。解码器优先(GPT 风格)和编码器优先(BERT 风格)是两种截然不同的设计选择,决定了模型能做什么。

但一个能「续写文本」的模型不等于「有帮助的助手」。预训练给了知识,监督微调(SFT)教会了对话格式,RLHF用人类的偏好判断进一步打磨——这三步连在一起,才造就了 ChatGPT。

在规模与效率之间,工程师发明了一系列折中方案:FlashAttention 让注意力在 GPU 片上缓存内完成、不反复读写慢速显存;MoE 让模型有更多参数但每次只激活一小部分;知识蒸馏让大模型的能力传给小模型。到这一卷结束,ChatGPT 不再是魔法。

承上启下
← 你带着什么走进这一卷

卷三结尾留下的难题——「必须按顺序读、无法并行」——就是这一卷的开场。一个叫「注意力」的想法,把它干净利落地解决了。

这一卷又交给后面什么 →

这是最后一卷。读完它你会发现:从卷一第一课那个向量,到 ChatGPT,是一条没有断点的路——AI 不是魔法,是一连串可以追溯的数学与工程决策。

课程路径 · 12 课
19
注意力机制读到「它太累了」时,电脑怎么知道「它」指动物还是汽车?让每个词自己学会四处张望、寻找最该关注的焦点
读 →
20
多头注意力一句话里既有语法指代、又有情绪色彩,一个头忙不过来?并排派出多组注意力侦察兵,全方位洞察语义!
读 →
21
Transformer 架构彻底扔掉循环链条!把自注意力、前馈网络和高速残差通道巧妙拼装,造就当今大模型最强大的工业发动机
读 →
22
Tokenizer 分词器大模型眼里的文字到底长什么样?揭秘为什么它经常数不对“strawberry”里究竟有几个字母 r
读 →
23
编码器、解码器与大语言模型同样是 Transformer 家族,为什么 BERT 擅长做理解考试,而 GPT 却能一路进化成无所不能的写作高手?
读 →
24
残差连接与层归一化叠了上百层网络的庞然大物,传信号时怎么做到不衰减、不迷路?——给梯度修一条直达底层的高速公路线
读 →
25
预训练 · 监督微调 · 强化学习刚出炉的大模型只会胡言乱语接下文,它是如何通过「博览群书、高人指点、奖罚纠偏」三步蜕变成贴心助手的?
读 →
26
KV 缓存、稀疏注意力与 FlashAttention让大模型一口气读完整本书,计算量真的会爆炸吗?工程师们用来大幅提速、降低显存的省流加速秘籍
读 →
27
MoE 混合专家架构拥有万亿参数的巨无霸模型,每次回答问题却只调动几位专家脑细胞——解密“混合专家”的高效分工策略
读 →
28
模型蒸馏怎么把千亿大模型的毕生功力,高效传授给能装进手机的小模型?——软标签里蕴藏的“暗知识”教学法
读 →
29
串讲:从 N-gram 到 Transformer别被繁杂的技术名词吓退!一文串起从最简单的数数到当今大模型的演进脉络——每一代创新都是为了打破上一代的枷锁
读 →
30
前沿与未来:下一程ChatGPT 引爆全球之后,未来的大模型还会朝哪个方向进化?下一程前沿探索
读 →