STE AI GUIDE AI基础知识学习指南
首页目录 卷I 基础数学卷II 神经网络卷III 自然语言处理卷IV 大语言模型卷V 附录
I 基础数学
  • 00 什么是线性代数
  • 01 什么是向量
  • 02 向量的常见运算
  • 03 什么是矩阵
  • 04 什么是线性变换
  • 05 什么是梯度
  • 06 概率与信息

II 神经网络
  • 07 神经元结构
  • 08 激活函数
  • 09 神经网络与训练
  • 10 损失函数
  • 11 Softmax
  • 12 梯度下降与优化器
  • 13 反向传播

III 自然语言处理
  • 14 语言的概率游戏:N-gram
  • 15 词向量
  • 16 前馈神经网络语言模型
  • 17 RNN 循环神经网络
  • 18 LSTM 长短期记忆网络

IV 大语言模型
  • 19 注意力机制
  • 20 多头注意力
  • 21 Transformer 架构
  • 22 Tokenizer 分词器
  • 23 编码器、解码器与大语言模型
  • 24 残差连接与层归一化
  • 25 预训练 · 监督微调 · 强化学习
  • 26 KV 缓存、稀疏注意力与 FlashAttention
  • 27 MoE 混合专家架构
  • 28 模型蒸馏
  • 29 串讲:从 N-gram 到 Transformer
  • 30 前沿与未来:下一程

V 附录
  • 附1 Transformer全景图
  • 附2 《Attention Is All You Need》原文
  • 附3 综合测试

附录1 · 卷五 附录

Transformer全景图

← 上一课:30 前沿与未来:下一程下一课:附2 《Attention Is All You Need》原文 →