09 · 模型适配:模型剧变时引擎在哪一层吸收
结论:三层适配——模型层吸收「算什么」、运行时层吸收「状态长什么样」(最贵)、算子层吸收「怎么算」;通用抽象扩大范围,特化 kernel 守住性能。
%%{init: {"flowchart": {"wrappingWidth": 230}}}%%
flowchart LR
Q{"新模型改了什么?"}
Q -- "算什么:层的结构、激活、归一化" --> M["模型层<br/>一个文件 + 注册 ModelRegistry"]
Q -- "状态长什么样:KV 的形状(MLA 512 + 64)" --> R["运行时层<br/>KVCacheManager、block 布局、attention metadata——最贵"]
Q -- "怎么算:量化、新 kernel" --> K["算子层<br/>QuantizationConfig + LinearMethod、Attention Backend"]
classDef hot fill:#fde2e2,stroke:#b91c1c
class R hot
COMMENTS
评论存放在 GitHub Discussions, 用 GitHub 账号登录即可发表,支持 Markdown。 想针对正文某句话说?选中那段文字,点浮出的「评论」即可划线评论;觉得哪里写错了,发表时勾上「同时提交 Issue」。 有人回复你时 GitHub 会按你的通知设置发邮件,不用守在这里。