零门槛 · 纯离线 AI 大模型原理探索

AI大模型底层原理图解指南

无需高深数学背景,带你像玩积木一样拆解 AI 大模型!从「高维空间与线性代数宏观图谱」,到「怎么用一串数字向电脑描述一只猫」,再到神经网络、注意力机制,直到撑起 ChatGPT 的 Transformer、混合专家与模型蒸馏。全套 31 堂硬核又好懂的科普漫游课 + 3 篇原典探索与综合大考,配齐交互动画与生动图解,纯离线即开即学。

开始探索第 00 课:从零认识线性代数 →
IV

大语言模型

彻底引爆 AI 革命:从注意力到 ChatGPT
卷IV 导读与全景 →
19

注意力机制

读到「它太累了」时,电脑怎么知道「它」指动物还是汽车?让每个词自己学会四处张望、寻找最该关注的焦点

→
20

多头注意力

一句话里既有语法指代、又有情绪色彩,一个头忙不过来?并排派出多组注意力侦察兵,全方位洞察语义!

→
21

Transformer 架构

彻底扔掉循环链条!把自注意力、前馈网络和高速残差通道巧妙拼装,造就当今大模型最强大的工业发动机

→
22

Tokenizer 分词器

大模型眼里的文字到底长什么样?揭秘为什么它经常数不对“strawberry”里究竟有几个字母 r

→
23

编码器、解码器与大语言模型

同样是 Transformer 家族,为什么 BERT 擅长做理解考试,而 GPT 却能一路进化成无所不能的写作高手?

→
24

残差连接与层归一化

叠了上百层网络的庞然大物,传信号时怎么做到不衰减、不迷路?——给梯度修一条直达底层的高速公路线

→
25

预训练 · 监督微调 · 强化学习

刚出炉的大模型只会胡言乱语接下文,它是如何通过「博览群书、高人指点、奖罚纠偏」三步蜕变成贴心助手的?

→
26

KV 缓存、稀疏注意力与 FlashAttention

让大模型一口气读完整本书,计算量真的会爆炸吗?工程师们用来大幅提速、降低显存的省流加速秘籍

→
27

MoE 混合专家架构

拥有万亿参数的巨无霸模型,每次回答问题却只调动几位专家脑细胞——解密“混合专家”的高效分工策略

→
28

模型蒸馏

怎么把千亿大模型的毕生功力,高效传授给能装进手机的小模型?——软标签里蕴藏的“暗知识”教学法

→
29

串讲:从 N-gram 到 Transformer

别被繁杂的技术名词吓退!一文串起从最简单的数数到当今大模型的演进脉络——每一代创新都是为了打破上一代的枷锁

→
30

前沿与未来:下一程

ChatGPT 引爆全球之后,未来的大模型还会朝哪个方向进化?下一程前沿探索

→