07 · MTP:改训练目标而不改主干
结论:每个位置额外预测 \(t_{i+2}\),信号密度 ×(1 + D),主干被逼编码更远的未来;模块顺序喂真实 \(t_{i+1}\) 保持因果链(teacher forcing 的延伸);推理时丢弃或当投机 draft。
%%{init: {"flowchart": {"wrappingWidth": 220}}}%%
flowchart LR
T["主干 Transformer<br/>h_i"] --> H0["lm_head → 预测 t_{i+1}<br/>L_main"]
T --> C["RMSNorm(h_i) ‖ RMSNorm(emb(t_{i+1}))<br/>投影 2d → d"]
E["真实 t_{i+1}"] --> C
C --> BLK["一个 Transformer block"] --> H1["共享 lm_head → 预测 t_{i+2}<br/>λ · L_MTP"]
classDef mtp fill:#e0e7ff,stroke:#4338ca
class C,BLK,H1 mtp
COMMENTS
评论存放在 GitHub Discussions, 用 GitHub 账号登录即可发表,支持 Markdown。 想针对正文某句话说?选中那段文字,点浮出的「评论」即可划线评论;觉得哪里写错了,发表时勾上「同时提交 Issue」。 有人回复你时 GitHub 会按你的通知设置发邮件,不用守在这里。