题目总数
20 题
满分设定
100 分 (每题5分)
考核模式
全卷作答 · 统一交卷
当前进度
0 / 20 已完成
题卡快速导航(点击题号可直接跳转,已作答将高亮显示):
还有 20 题待作答
TEST REPORT · 成绩报告单
成绩结算中...
0 / 100 分
评语生成中...
✓ 答对 0 题 (+0 分)
✕ 答错 0 题
⚠️ 未作答 0 题
模块 一
基础数学与空间直觉 (共 5 题,25 分)
涵盖相关章节最核心的底层数学逻辑与物理直觉,请仔细审题并选出最佳选项。
Q01
在大模型与自然语言处理中,计算机为什么要把现实中的词语(如“猫”、“狗”、“国王”)转化为多维空间里的「向量(Vector)」?
5 分
A
计算机只能处理结构化关系数据库,将词语转为向量是为了建立外键索引并实现快速哈希查找
B
纯粹为了将字符串压缩以大幅缩减内存开销,并借助无损编码算法在磁盘与显存间实现极速传输
C
将离散符号映射为连续几何坐标,使得机器能用空间距离和夹角量化语义相似度并进行连续计算
D
统一消除中文与英文等自然语言之间的语法差异,使模型无需学习语法规则就能直接翻译各国文字
【解析】 向量的核心意义是“可计算的语义”。计算机本身无法理解孤立的字词,但一旦将它们映射为空间中的坐标,语义相近的词在空间中就会彼此靠近,机器就能用距离或方向夹角精准量化它们“有多像”,这是大模型理解世界的最根本起点。
Q02
在计算两个词向量的语义关联度时,人们普遍倾向于使用「余弦相似度(Cosine Similarity)」而不是直接使用点积,最关键的原因是:
5 分
A
点积运算的数值范围是严格无界的正数,而余弦相似度通过非线性映射被压缩到了严格的 [0, 1] 概率区间
B
现代 GPU 架构硬件指令集对夹角三角函数计算提供了专门的张量核心加速,执行效率远高于传统乘加点积
C
点积只能度量两向量在欧氏空间中的绝对几何距离,完全无法捕捉两向量在语义特征维度上的方向平行程度
D
点积大小受向量模长干扰,高频词常因模长偏大虚高;余弦相似度除以各自模长,仅纯粹衡量空间夹角方向
【解析】 两个向量的点积大小同时受“夹角”和“模长”的综合影响(A·B = |A||B|cosθ)。如果一个常见词在语料中出现极其频繁导致其向量模长很大,点积就会虚高。余弦相似度通过除以两者的模长,彻底剥离了长度的干扰,只纯粹看两支向量在空间中的“眼神夹角”,更准确稳定。
Q03
在空间几何直觉中,一个「线性变换(Linear Transformation)」必须满足的最本质特征是什么?
5 分
A
原点固定不动,且原本平直、等距平行的空间网格线变换后依然保持平直且等距平行
B
坐标原点随变换整体平移,原本弯曲的流形曲面在变换后被强制展开拉平为欧几里得超平面
C
严格保持所有输入向量的绝对模长和两两夹角恒定不变,不允许发生任何形式的缩放与剪切形变
D
必须把高维特征空间整体正交投影到低维直线或平面上,直接舍弃对任务无贡献的冗余特征分量
【解析】 线性变换必须严格保持线性运算性质:T(u+v)=T(u)+T(v) 以及 T(cu)=cT(u)。在几何上直观表现为:空间原点固定不动,直线变换后仍为直线,平行且等距的网格线变换后依然平行且等距。神经网络中的矩阵乘法 Wx 正是执行这种空间拉伸、旋转与切变。
Q04
深度学习中常把模型训练形象地比作“在浓雾中下山寻底”。这里的「梯度(Gradient)」所指的方向究竟是什么?
5 分
A
从当前参数坐标点出发,直接穿透浓雾笔直指向损失曲面全局最低谷底的绝对理论捷径
B
函数在当前点上升最陡峭的方向,因此要让损失降低需沿着负梯度方向更新参数
C
沿当前曲面等高线切线向前滑行的中立方向,保证损失函数在迭代中绝不会发生反弹或震荡
D
综合模型历史所有迭代轮次中参数变化量加权滑动平均后的全局惯性动量推进方向
【解析】 多元函数的梯度是一个由各个偏导数构成的向量,它指向的是“当前位置函数值增长最快(最陡上坡)”的方向。因为深度学习的目标是最小化损失函数(寻找海拔最低点),所以参数更新必须沿着梯度的相反方向——即“负梯度”方向迈出步长,这就是梯度下降法的核心数学逻辑。
Q05
在多分类任务与大语言模型训练中,普遍使用「交叉熵损失(Cross-Entropy Loss)」作为优化目标,其主要的惩罚机制是:
5 分
A
当模型输出的各类预测概率之和不严格等于 1 时,对违背柯尔莫哥洛夫公理系统的离散分布违规误差施加指数级强惩罚
B
强制网络中所有错误类别的预测置信度必须均匀分布,一旦出现某个错误分类置信度偏高就处以重罚
C
直接计算预测概率分布与均匀分布之间的香农熵差异,以此惩罚模型决策过程中产生的不确定性与犹豫
D
模型对真实目标类别给出的预测概率越低,其负对数损失 −ln(p) 越趋向正无穷大,由此产生剧烈纠偏信号
【解析】 交叉熵衡量的是模型预测概率分布与真实标签分布之间的差距。对于单个样本,交叉熵损失为 −ln(p_true)。当模型给正确答案预测的概率 p → 1 时,损失趋近于 0;而一旦模型对正确答案极其不自信(p → 0),负对数将急剧飙升至无穷大,形成巨大的梯度信号推动参数剧烈纠偏。
模块 二
神经网络与深度学习 (共 5 题,25 分)
涵盖相关章节最核心的底层数学逻辑与物理直觉,请仔细审题并选出最佳选项。
Q06
一个标准的人工神经元完成的核心数学计算流程是:
5 分
A
对输入的各个特征维度执行逐元素最大池化与动态舍入,以此模拟生物突触的“全或无”二进制脉冲响应
B
将输入特征全部映射到复数频域执行傅里叶变换,提取频域相位特征后再通过阈值门控函数滤波输出
C
计算所有输入特征的线性加权和并叠加上偏置常数(z = w·x + b),最后传入非线性激活函数映射
D
将所有输入特征直接相乘后除以输入维度的平方根,从而计算出多特征之间的联合相关性并作为激活输出
【解析】 人工神经元本质上是一个“带阈值的加权投票器”:权重 w 决定了各个输入特征的相对重要性,偏置 b 调节了神经元的触发门槛(决定决策面离开原点的平移量),最后经过非线性激活函数赋予其非线性决策能力。
Q07
为什么深度神经网络必须在层与层之间加入非线性「激活函数(如 ReLU、GELU 等)」?
5 分
A
线性变换的复合仍是线性变换,不加激活则百层网络也退化为单层,无法拟合复杂非线性规律
B
浮点数矩阵连续相乘会导致数值下溢崩溃,必须利用激活函数强制把输出数值限制在 [0, 1] 范围内
C
只有通过非线性激活函数对网络权重施加正交化约束,才能彻底避免反向传播时发生梯度爆炸或消失
D
激活函数能够自动识别并丢弃输入特征中的高频噪声,从而代替人工特征工程实现端到端的特征降维
【解析】 线性变换的复合仍是线性变换——一百层平平无奇的直线叠起来数学上依然只是一条直线。没有非线性激活,深层网络的“深度”就完全失去了意义。激活函数给空间引入了“折弯与拐角”,才让网络能够逼近现实中千变万化的任意复杂函数。
Q08
神经网络的一次标准训练迭代(Training Step),其核心环节前后执行的正确顺序是:
5 分
A
优化器更新参数 → 损失函数评估误差 → 前向传播生成预测 → 反向传播推导梯度
B
前向传播计算预测 → 损失函数评估误差 → 反向传播推导梯度 → 优化器更新参数
C
反向传播推导梯度 → 优化器更新参数 → 前向传播生成预测 → 损失函数评估误差
D
损失函数评估误差 → 前向传播生成预测 → 优化器更新参数 → 反向传播推导梯度
【解析】 标准的深度学习训练流水线为:1. 前向传播(输入数据流经网络各层算出预测值);2. 损失评估(对比预测值与真实标签算得当前误差 Loss 标量);3. 反向传播(利用链式法则自顶向下求出 Loss 对各层参数的偏导梯度);4. 参数更新(优化器根据梯度和学习率对权重与偏置微调)。
Q09
在大模型文本生成中,调节采样温度(Temperature,T)改变了模型输出的风格,关于温度 T 的数学机理,正确的是:
5 分
A
温度参数用于线性缩放激活函数的截断阈值,T 越大则神经元被激发的概率越低,模型回答越保守谨慎
B
温度 T 越高,模型输出概率分布越尖锐,最高得分项的概率被无限放大,从而保证代码生成的严谨正确
C
温度 T 实际上控制的是 GPU 显存缓存淘汰策略,调高 T 可以允许模型在生成时并行调用更大的知识库上下文
D
温度越高会缩小各类得分除以 T 后的相对差距,使概率分布平缓多变;温度越低分布越陡峭,结果更确定严谨
【解析】 Softmax 公式为 P_i = e^(z_i / T) / Σ e^(z_j / T)。当 T 较高时,z_i / T 的相对差距被缩小,所有候选词的概率变得更加均匀,带来了更高的随机性和创造性(适合写故事、头脑风暴);当 T 较低(如 0.2)时,优势词被大幅放大,概率分布极度陡峭,生成结果严谨确定(适合写代码、解数学题)。
Q10
反向传播(Backpropagation)算法能够高效算出网络中数以亿计的权重分别该承担多少“纠错责任”,其依赖的底层核心数学工具是:
5 分
A
泰勒级数在平衡点附近的二阶高维海森矩阵逼近展开法
B
基于蒙特卡洛随机采样与大数弱定律支持下的高维马尔可夫决策过程
C
多元复合函数微积分中的链式法则(Chain Rule)
D
欧拉路径遍历与有向无环图上的最大流最小割图论算法
【解析】 复合函数的导数可以通过链式法则分解为一系列局部导数的连乘(∂L/∂x = ∂L/∂y · ∂y/∂x)。反向传播正是利用这一法则,从输出端向输入端逐层递推,充分复用上一层的误差敏感度中间值,避免了重复计算,从而将求导的复杂度降到了与前向传播同等量级。
模块 三
自然语言处理演变史 (共 4 题,20 分)
涵盖相关章节最核心的底层数学逻辑与物理直觉,请仔细审题并选出最佳选项。
Q11
传统的统计学语言模型 N-gram(如 3-gram)在预测下一个词时,所依赖的基本原理及其核心致命弱点分别是:
5 分
A
依赖前 N−1 词统计频次;致命弱点是数据稀疏,未见词组合概率直接估为 0 且毫无语义泛化能力
B
依赖深度双向自注意力机制;致命弱点是两两词对交互计算使得矩阵内存随序列长度呈现平方级激增
C
依赖有限状态自动机与上下文无关语法树;致命弱点是人工维护语法规则代价高昂且难以支持口语歧义
D
依赖隐藏状态在时序步上的递归循环传递;致命弱点是在长文本跨步连乘时必然导致梯度的指数级衰减与梯度爆炸
【解析】 N-gram 不懂得词语的语义,完全依靠统计“语料库中这串词后面最常接哪个词”。当 N 稍稍增大,大部分合理的词语组合在训练语料库中出现的次数都是 0(数据稀疏与零概率问题),同时模型只能看到极其局限的局部窗口,无法理解长句子。
Q12
Word2Vec 之所以能够展现出诸如“国王 - 男人 + 女人 ≈ 女王”的神奇向量代数特征,是因为它遵循了语言学的哪一重要假设?
5 分
A
乔姆斯基生成语法假设:所有自然语言底层都共享完全一致的深层先天形式句法转换规则
B
齐夫定律长尾假设:词频与排序序号成严格反比,低频罕见词所承载的语义信息量远大于高频功能词
C
萨丕尔-沃尔夫假说:人类思考所使用的语言词汇系统在物理上决定了大脑认知高维世界的方式
D
分布式假设:常出现在相似上下文语境中的词含义相近,借由上下文预测将语义关系投射为几何位移
【解析】 分布式假说的名言是“You shall know a word by the company it keeps(观其伴而知其意)”。Word2Vec 通过在大规模语料中让词与它的上下文互相预测,将“性别”、“时态”、“职业”等抽象语义关系投射成了空间中方向一致的位移向量,从而使得向量加减具备了类比推理的能力。
Q13
与固定窗口的前馈神经网络语言模型(NNLM)相比,循环神经网络(RNN)引入的最关键结构创新是什么?
5 分
A
彻底弃用了全连接权重矩阵,改用一维膨胀因果卷积层来成倍扩大有效感受野
B
引入随时间步递归传递的隐藏状态,像流动管道一样在理论上能持续传递上文记忆
C
在输入端引入静态正弦位置编码,使网络无须循环就能天然感知序列中词语的前后顺序
D
为每个输入词并行构建查询、键、值三组向量,直接计算跨位置的全局关联匹配权重
【解析】 前馈模型只能把前 k 个词拼接起来,窗口一旦固定就完全“看不到”更早的信息。RNN 创造性地引入了递归时序连接:在处理当前词 x_t 时,不仅接收当前输入,还同时吃进上一时刻的隐藏状态 h_(t-1),将历史信息不断浓缩滚动下传,让网络拥有了处理变长文本的“动态记忆管道”。
Q14
普通 RNN 在实际应用中很难捕捉超过几十个时间步的长距离依赖,而 LSTM 成功缓解这一问题的核心秘密是:
5 分
A
强制所有隐藏层神经元采用 ReLU 替代 Tanh 激活函数,从而在数学上彻底根除负数梯度衰减
B
引入双向注意力掩码并冻结浅层参数,使反向传播求导时无需再跨越漫长的时序展开链条
C
引入门控结构与加法式细胞状态通路,使关键历史信息与反向梯度能近乎无损地顺着传送带长流
D
将每一时刻的隐藏状态向量压缩为标量并存入全局哈希表,通过精确键值检索实现瞬时召回
【解析】 普通 RNN 的反向传播需要不断跨时间步连乘权重矩阵 W,极易引发指数级梯度消失或爆炸。LSTM 专门开辟了一条“加法式传送带”——细胞状态 C_t,门控通过点乘有选择地遗忘和写入,误差梯度在回传时可以顺着加法通道近乎无损地流向早期步,从而保留关键的长距离记忆。
模块 四
大语言模型与Transformer (共 5 题,25 分)
涵盖相关章节最核心的底层数学逻辑与物理直觉,请仔细审题并选出最佳选项。
Q15
在 Transformer 的自注意力计算中,查询(Query, Q)、键(Key, K)和值(Value, V)在直观语义上各自代表什么?
5 分
A
Q 是“我在找什么”,K 是“我提供什么供匹配”,V 是匹配后实际抽取的“信息内容”
B
Q 是输入词向量的绝对坐标,K 是反向传播时的导数偏置,V 是模型预测下一词的最终概率分布
C
Q 代表前向推理计算量,K 代表当前缓存所占显存带宽,V 代表多头注意力并行时的线程并发度
D
Q、K、V 在概念与结构上完全相同,只是将同一组输入嵌入向量线性复制三份以满足并行规约
【解析】 自注意力模拟了检索匹配过程:每个 Token 产生自己的 Q、K、V。拿当前位置的 Q 去与所有位置的 K 计算点积相容度,再经过 Softmax 得到归一化的注意力权重矩阵;最后以此权重对所有位置的 V 进行加权求和,把与自己最相关的信息聚合过来。
Q16
标准 Transformer 层中,在自注意力子层和前馈网络(FFN)子层外侧,都包裹着哪两个不可或缺的“工程地基”?
5 分
A
抑制神经元共适应的随机失活通道(Dropout)与降采样最大池化机制(Max Pooling)
B
保障深层梯度畅流的残差连接(Residual)与稳定数值特征尺度的层归一化(LayerNorm)
C
基于样本批次统计量的批量归一化(BatchNorm)与低秩权重奇异值分解压缩(SVD)
D
防止梯度在深层失控暴增的梯度裁剪(Clipping)与周期性学习率余弦退火策略
【解析】 Transformer 堆叠几十甚至上百层深度的底气正来自于“残差连接 + 层归一化(Add & Norm)”。残差连接 x + SubLayer(x) 为梯度修筑了一条直达底层的无衰减高速公路;层归一化则在每一层内部对特征分布进行标准化缩放,保证了百层深层网络在超大算力训练下的绝对稳定性。
Q17
现代大语言模型(如 GPT、LLaMA)大多采用子词分词算法(如 BPE、Byte-level BPE)。下列关于分词器的描述中,正确的是:
5 分
A
分词器将所有单词强制打碎为独立的单个英文字母,因此大模型天生就能准确数清任意生僻单词内的特定字母数量
B
分词器直接跳过文本切分步骤,直接将人类自然语言以 UTF-8 原始字节流形式送入第一层多头自注意力矩阵
C
子词算法在高频词与生僻碎片间取得平衡,常见词保留为整块而罕见词拆分,兼顾词表规模并消除未登录词问题
D
分词器构建的词表容量越大越好,工业级大模型必须容纳千万级词表才能完整表达中文诗词与成语的深层隐喻
【解析】 子词(Subword)分词是现代 NLP 的基石:既不采用庞大且易遇到生僻词的纯单词级词表,也不采用序列过长的纯单字符级。由于大模型接收的最小单位是 Token,像“strawberry”通常会被拆分成若干个子词块(如 straw + berry),模型在内部并不直接将它们当作独立字母逐个观察,这也解释了为何早期大模型常出现数不清内部字母的现象。
Q18
同为 Transformer 衍生模型,BERT(编码器架构)与 GPT(仅解码器架构)在核心机制上的最根本区别是:
5 分
A
BERT 内部完全移除了前馈网络 FFN 子层,而 GPT 内部则彻底废弃了自注意力计算,转为全连接前馈接龙
B
BERT 只能处理已完成分词的静态文本分类,而 GPT 必须同时处理多模态图像像素输入才能完成自回归续写
C
BERT 必须在多台 GPU 上串行逐层执行,而 GPT 由于采用解码器结构因此天生支持所有词语同时并行生成
D
BERT 采用双向自注意力可通视全局上下文适于理解,GPT 采用因果掩码遮蔽未来词天然适合逐词自回归接龙
【解析】 BERT 在编码时每个词都可以关注句子中所有前后的词(双向无遮蔽),非常擅长文本分类、阅读理解和信息抽取,但无法自然生成;GPT 在自注意力层引入了下三角因果掩码(Causal Mask),强制每个 Token 只能“看见”自己及之前的词,从而保证了严谨的单向自回归特性,推动其演化成了当今主流的生成式语言模型。
Q19
将一个刚初始化的大语言模型培养成类似于 ChatGPT 的实用助手,业界通用的三个核心训练阶段是:
5 分
A
海量无标注文本无监督预训练 → 高质量问答指令监督微调(SFT) → 基于人类反馈强化学习对齐(RLHF)
B
基于语料词频矩阵的降维预处理 → 循环神经网络时序特征记忆迁移 → 顶层逻辑回归分类器目标调优
C
超大规模教师模型软标签离线蒸馏学习 → 混合专家网络稀疏激活路由架构构建 → INT4 低比特硬件量化部署适配
D
专家规则知识库精确匹配注入 → 句法依存分析树模式串行对齐 → 基于安全黑名单过滤的强化对抗演练
【解析】 当今大模型训练的经典三部曲是:1. 预训练(在万亿 Token 文本上通过“预测下一个词”汲取世界知识与通用语言规律);2. 监督微调 SFT(利用数以万计的人工撰写优质问答示范,教会模型理解并服从用户指令格式);3. 强化学习对齐 RLHF(通过奖励模型和 PPO/DPO 等算法,让模型的回答更真实、有用且安全符合人类价值观)。
模块 五
原典探索与前沿 (共 1 题,5 分)
涵盖相关章节最核心的底层数学逻辑与物理直觉,请仔细审题并选出最佳选项。
Q20
在 2017 年发表的开山之作《Attention Is All You Need》中,作者团队在提出缩放点积注意力公式 Attention(Q, K, V) = softmax(QK^T / √d_k)V 时,为什么要专门除以缩放因子 √d_k?
5 分
A
维度越大计算消耗的显存带宽越高,除以根号项能在线性空间内成比例降低矩阵在 GPU 共享内存中的占用
B
维度较大时点积结果方差增大导致数值过大,除以根号项可将方差拉回 1,防止进入 Softmax 梯度饱和区
C
强制使注意力相容度打分矩阵的对角线自注意力数值归零,避免模型在多头计算中陷入过度关注自身的退化
D
缩放因子对应模型总堆叠层数,层数越深除数越大,其数学目的是替代残差连接以抑制层间数值单调递增
【解析】 原论文 3.2.1 节明确指出:假设 Q 和 K 的各个分量是独立的零均值单位方差随机变量,它们的点积均值为 0,方差却高达 d_k。当 d_k 很大时(如 64 或更高),点积的结果绝对值会变得极大,进入 Softmax 之后输出会极度贴近 0 或 1,导致该区域的导数极其接近于 0(梯度消失/饱和),模型难以继续更新学习。除以 √d_k 巧妙地将方差拉回 1,保证了反向传播梯度的健康稳定流动。
交卷
提交试卷与成绩评估
📋 准备好了吗?
点击下方按钮后,系统将正式锁定您的选择并立即完成试卷判分。所有题目的正误标记、得分明细及详细解析将统一展示在各题下方。
📝 提交试卷并计算总分
当前已作答 0 / 20 题
↑
COURSE & EXAM COMPLETED
🎉 恭喜完成全部课程与综合测试!
从基础数学到现代 Transformer,从单神经元到原典论文与综合测试,你已经扎扎实实走完了大模型底层原理的全部征程!点击返回首页学习地图。