Transformer 与 LLM(05):Transformer 解剖与参数量
Transformer Anatomy and Parameter Count: From config.json to 8.03B
第三篇末尾那张对照表说:Llama 相对 GPT-2 只改了五处——LayerNorm 换成 RMSNorm、位置表换成 RoPE、GELU 两矩阵 FFN 换成 SwiGLU 三矩阵、K/V 投影变窄(GQA)、去掉所有 bias。第二段从这里开始:先讲每一处为什么改(各解决什么问题、代价是什么),再把改完的结构拆到能数出每一个参数的粒度。这一篇之后你会被问到这样的问题:这个模型有多少参数?一张 80 GB 的卡放得下吗?某个 GEMM 的 \(m, k, n\) 是多少?为什么 Llama 的 FFN 中间维度是 14336 这样一个看起来不整的数?这些问题的答案全部藏在一个几十行的 config.json 里,不需要下载权重,也不需要运行代码。
本篇要建立的...