Arganzheng's Blog

stay hungry, stay foolish

AI 平台工程:资源层与交付层(总纲)

AI Platform Engineering: the Resource Layer and the Delivery Layer

内容简介 《AI 平台工程:资源层与交付层》是一组共八篇的系列文章,面向已经跑过训练任务或推理服务、准备把它们放到一个多人共用的 GPU 集群上运行和交付的工程师,系统讲解引擎之下和引擎之侧的两层基础设施:资源层把 GPU、网络、存储组织成可调度的资源池,承载引擎运行;交付层把引擎包装成有 SLA、有配额、有账单、可观测的服务。 它回答的问题是: 一个 GPU 集群如何被切分、调度和喂饱?一个训好的模型如何变成一个可运维的服务? 站在引擎的层面看,平台是一个”给我八张卡、一个 RDMA 网口和一个能读 checkpoint 的路径,剩下的我自己来”的黑盒。这个视角是对的,但它掩盖了一件事:平台的每一个设计决定,都是被引擎的某个需求推出来的。 ...

大模型推理系统揭秘(12):回到源码:一次请求在 vLLM 内部的真实旅程

NOTE 本文基于 vLLM v0.27.1(tag 6e448d0, 2026-08-11)源码剖析。文中文件路径、类名和函数名均以该版本为准;vLLM 迭代很快,阅读时请以你手上的版本对照。 前九章回答了「是什么」和「为什么」,这一章回答「怎么实现」。 现在你已经知道 Scheduler 为什么要按 token 预算调度、KV Cache 为什么要分块、Attention Backend 为什么要按 batch 形态分派。带着这些「为什么」回头看数据结构,它们就不再是需要背的字段列表,而是每一个都能对应到一个设计约束。 这一章刻意放在最后:如果它出现在第二章,你只会看到一堆 class;出现在这里,你会看到设计决策留下的痕迹。 1. 控制...

大模型推理系统揭秘(11):Serving Infra 的下一站:从模型执行器到分布式智能操作系统

NOTE 本文基于 vLLM v0.27.1(tag 6e448d0, 2026-08-11)源码剖析。文中文件路径、类名和函数名均以该版本为准;vLLM 迭代很快,阅读时请以你手上的版本对照。 在前面的章节中,我们围绕 vLLM 的核心机制展开了讨论:模型如何加载,算子如何执行,请求如何调度,以及 KV Cache 如何管理。 这些机制解决的是一个核心问题: 如何让一次模型推理更高效? 但在真实生产环境中,请求正在变得越来越复杂。一个请求可能包含超长上下文、多轮对话、工具调用、Session 状态,以及图像、音频或视频输入。它不再是一次短暂的函数调用,而可能是一个持续数分钟甚至数小时的分布式任务。 因此,Serving 系统需要管理的对象...

大模型推理系统揭秘(10):PD 分离:从资源混部走向计算解耦

本文是《大模型推理系统揭秘:从 vLLM 看 LLM Serving Infra 核心技术》系列的第十篇。上一篇:硬件解耦 下一篇:Serving Infra 的下一站。 版本说明:实现分析以 vLLM v0.27.1(tag 6e448d0)为准,重点走读 NIXL pull + 示例 Proxy 的交接路径。通用架构、其他 Connector 的选择和系统设计建议会分别说明,不把一种实现视为 PD 分离的唯一路径。文中算例均为注明假设的理论估算,不是本地 GPU 或网络实测。 前面几篇已经解释了,一个推理实例如何通过 Scheduler、KV Cache Manager、Model Runner 与多卡执行器,把动态到来的请求组织成持续运行的 G...

大模型推理系统揭秘(09):硬件解耦:如何不让芯片差异污染 Serving 核心?

NOTE 本文基于 vLLM v0.27.1(tag 6e448d0, 2026-08-11)源码剖析。文中文件路径、类名和函数名均以该版本为准;vLLM 迭代很快,阅读时请以你手上的版本对照。 上一章讨论了模型适配:面对不断变化的模型结构,Serving 框架如何通过统一接口、模型注册和模块化执行路径,降低新模型接入成本。 但模型只是变化来源之一。 在真实部署环境中,硬件同样在快速变化。GPU 不再是唯一选择,AMD ROCm、华为昇腾 Ascend、Intel XPU、Google TPU 以及各种专用加速器,都在参与大模型推理基础设施的竞争。 这就带来一个更棘手的问题: 如何让同一套 Serving 逻辑运行在不同芯片上,同时避免芯片差...

大模型推理系统揭秘(08):模型适配:如何跟上变化极快的模型世界?

NOTE 本文基于 vLLM v0.27.1(tag 6e448d0, 2026-08-11)源码剖析。文中文件路径、类名和函数名均以该版本为准;vLLM 迭代很快,阅读时请以你手上的版本对照。 1. 痛点:为什么推理引擎必须持续适配新模型? 1.1 模型算法同质化与工程实现异构化 LLM 模型在算法上高度同质,都是基于 Transformer模型,围绕以下组件构建: Embedding; Transformer Block; Attention; Feed-Forward Network; Normalization; LM Head。 但模型的工程实现上却是高度异构化: 维度 ...

大模型推理系统揭秘(07):Multi-GPU:一张卡不够时如何扩展?

NOTE 本文基于 vLLM v0.27.1(tag 6e448d0, 2026-08-11)源码剖析。文中文件路径、类名和函数名均以该版本为准;vLLM 迭代很快,阅读时请以你手上的版本对照。 1. 分布式推理的混合并行策略 分布式推理的混合并行策略: 遇到的问题 该用的策略 切的是什么 单张卡放不下一个 Linear 层 TP 层内的矩阵,按行/列切 单层放得下,但整个模型太大 PP 按层切,分段流水 MoE 的 Expert 太多 ...

大模型推理系统揭秘(06):GPU 执行:如何让每个 Token 算得更快?

NOTE 本文基于 vLLM v0.27.1(tag 6e448d0, 2026-08-11)源码剖析。文中文件路径、类名和函数名均以该版本为准;vLLM 迭代很快,阅读时请以你手上的版本对照。 这一章的问题是:这些已经确定要算的 token,怎么算得更快。 Decode 偏 memory-bound、Prefill 偏 compute-bound,但落到 GPU 上,浪费其实只有四种形态: 浪费形态 症状 对策 GPU 在等 CPU 发指令 kernel 之间有气泡 CUDA Graph GPU 在...

大模型推理系统揭秘(05):KV Cache:LLM Serving 的第一号内存问题

NOTE 本文基于 vLLM v0.27.1(tag 6e448d0, 2026-08-11)源码剖析。文中文件路径、类名和函数名均以该版本为准;vLLM 迭代很快,阅读时请以你手上的版本对照。 设想一个场景: 你有一张 80 GB 的卡,同时来了 100 个请求。第一个请求最后只生成了 300 个 token,第二个生成了 3000 个,第三个一路写到 20K。问题在于:这三个数字,你在请求到达的那一刻一个都不知道。 如果按传统做法,给每个请求划一块连续显存来放它的 KV Cache,那你只能按”最坏情况”预留——按模型支持的最大长度划。于是那个只生成 300 token 的请求,占着一块够装 32K token 的地。100 个请求这么一摊,卡就满...

大模型推理系统揭秘(04):Scheduler:GPU 这一轮到底给谁用?

NOTE 本文基于 vLLM v0.27.1(tag 6e448d0, 2026-08-11)源码剖析。文中文件路径、类名和函数名均以该版本为准;vLLM 迭代很快,阅读时请以你手上的版本对照。 前面我们已经解决了一个重要问题: KV Cache 如何管理? PagedAttention 将 KV Cache 从连续的大块显存变成可以按 Block 动态分配和回收的资源,使得不同请求可以灵活共享 GPU 显存。 但有了 KV Cache 之后,还有一个更直接的问题: GPU 这一轮到底给谁用?每个请求这一轮应该推进多少? 这正是 Scheduler 要解决的问题。 传统深度学习推理通常以固定 Batch 为基本调度单位: Ba...

×