01 · 负载画像:一步 RL 里发生什么
结论:8B、64 张 H100 做 GRPO——FLOP 上训练占一半、生成六分之一;时间上生成占四分之三;全步 MFU 13%。
%%{init: {"flowchart": {"wrappingWidth": 330}}}%%
flowchart TB
P["512 个 prompt"] --> G["<b>① 生成</b>:推理引擎,每 prompt 采 16 条<br/>decode、memory-bound、最长那条决定墙钟——<b>602 s</b>(长尾 196 s)"]
G --> R["<b>② 打分 + 前向</b>:奖励 + 策略、参考模型 logprob<br/>prefill 形态、compute-bound——72 s"]
R --> T["<b>③ 训练</b>:反向 + 优化器更新,6N × token——136 s"]
T -- "新权重同步回推理引擎(04)" --> G
COMMENTS
评论存放在 GitHub Discussions, 用 GitHub 账号登录即可发表,支持 Markdown。 想针对正文某句话说?选中那段文字,点浮出的「评论」即可划线评论;觉得哪里写错了,发表时勾上「同时提交 Issue」。 有人回复你时 GitHub 会按你的通知设置发邮件,不用守在这里。