Arganzheng's Blog

stay hungry, stay foolish

大模型推理系统揭秘(04):Scheduler:GPU 这一轮到底给谁用?

NOTE 本文基于 vLLM v0.27.1(tag 6e448d0, 2026-08-11)源码剖析。文中文件路径、类名和函数名均以该版本为准;vLLM 迭代很快,阅读时请以你手上的版本对照。 上一篇的全景图里已经出现了一个关键事实:KV Cache 不再是一整块连续显存,而是按 Block 动态分配和回收的资源(PagedAttention),不同请求因此可以灵活共享 GPU 显存——它的管理细节留到第五篇。有了”显存可以按块调配”这个前提,一个更直接的问题就浮上来了: GPU 这一轮到底给谁用?1 每个请求这一轮应该推进多少?2 这正是 Scheduler 要解决的问题。 传统深度学习推理通常以固定 Batch 为基本调度单位: Ba...

大模型推理系统揭秘(03):鸟瞰 vLLM:一个请求如何穿过整个推理系统?

NOTE 本文基于 vLLM v0.27.1(tag 6e448d0, 2026-08-11)源码剖析。文中文件路径、类名和函数名均以该版本为准;vLLM 迭代很快,阅读时请以你手上的版本对照。 前两篇分别定义了问题(LLM Serving 为什么难)和尺子(用什么指标衡量)。在深入调度、KV Cache、GPU 执行等单个战场之前,需要先有一张全景图:一个请求进入 vLLM 之后,会经过哪些模块,以什么形式被传递,最后如何变成 token 返回给用户。 本篇的核心问题是: 一个请求如何穿过 vLLM 的整个推理系统——哪个模块负责决策、哪个模块负责执行,它们之间传递的到底是什么?1 一、总览:静态拓扑、动态生命周期与数据流 1. 三个视角...

大模型推理系统揭秘(02):如何衡量一个 LLM Serving 系统?

NOTE 本文基于 vLLM v0.27.1(tag 6e448d0, 2026-08-11)源码剖析。文中文件路径、类名和函数名均以该版本为准;vLLM 迭代很快,阅读时请以你手上的版本对照。 上一篇说明了 LLM Serving 为什么难:服务对象变成了持续生成过程,Prefill 与 Decode 是两种不同的 Workload,吞吐与时延无法同时最优。在动手优化之前,还需要先回答一个更基本的问题——系统到底好不好、问题出在哪一段。 LLM Serving 的性能不能只看单一指标:延迟、吞吐、效率与服务质量四个维度各自暴露不同阶段、不同资源的瓶颈。本篇的核心问题是: 应该用哪些指标衡量一个 LLM Serving 系统?1 指标异常时,如何...

大模型推理系统揭秘(01):为什么 LLM Serving 比传统 DL 推理难?

NOTE 本文基于 vLLM v0.27.1(tag 6e448d0, 2026-08-11)源码剖析。文中文件路径、类名和函数名均以该版本为准;vLLM 迭代很快,阅读时请以你手上的版本对照。 传统深度学习推理通常围绕一个相对稳定的计算过程展开:输入一批形状相近的数据,执行一次前向传播,然后返回结果。 LLM Serving 则完全不同。一个请求可能携带几十个,也可能携带数万个输入 token;模型还需要逐个生成长度未知的输出 token。在这个过程中,系统必须动态管理请求、显存、KV Cache、批次和 GPU 计算资源。 因此,LLM Serving 的难点并不只是“模型更大”或“参数更多”,而是它改变了推理服务的基本执行模型: 从一次性...

大模型推理系统揭秘:从 vLLM 看 LLM Serving Infra 核心技术(总纲)

内容简介 《大模型推理系统揭秘:从 vLLM 看 LLM Serving Infra 核心技术》以 vLLM v0.27.1 为主要分析对象,从 LLM Serving 的问题本质出发,系统讲解请求生命周期、性能指标、调度、KV Cache、GPU 执行、解码的扩展(采样、投机解码与结构化输出)、多卡并行、模型适配、请求形态的扩展(multi-LoRA 与多模态)、硬件抽象、Prefill/Decode 分离与集群化部署,共十四篇。 本系列不局限于算子优化,也不止于源码解读,而是试图回答一个更完整的问题: 一个文本生成请求,为什么会逐渐演化成一个涉及计算、显存、调度、通信与状态管理的复杂系统? 在这个视角下,LLM Serving 不再只是“把模型跑...

大规模训练工程(09):系列总结与通关自测

Large-Scale Training Engineering: Series Recap and Final Self-Test

八篇正文回答了一个问题:一个千卡训练任务,怎么配、怎么跑满、怎么跑一个月不倒。前四篇是静态与稳态——第一篇算一张卡上四种状态的字节数与 FLOP,第二篇把每种并行写成”切哪种状态、付哪种通信”,第三篇追一个 bf16 参数在 Megatron-LM、DeepSpeed、torchtitan 里的一生,第四篇从模型与集群规格推出 70B / 1024 卡的配置并拆解 MFU 损失;后四篇是长时——第五篇把状态写到磁盘并允许换布局读回,第六篇算故障之后每一秒去了哪里,第七篇让数值不跑飞、数据可回放,第八篇把任务当作服务来运维。八篇合起来,是《大规模训练工程:从并行策略到容错恢复》总纲里”训练引擎这一层”的全部。 本文不讲新内容,做三件事:把八篇压成一张表与八段回顾,把...

大规模训练工程(08):长时训练的可观测与运维——从指标到 hang 排查

Observability and Operations for Long-Running Training

更新 @2026-09-06:本文 torchtitan 部分基于 v0.3.0 刷新;其余源码引用仍以 PyTorch 2.13.0 / Megatron Core 0.18.0 为准。 前七篇把一个千卡训练任务从”配出来”讲到”跑满”再讲到”不倒”:显存账、并行策略、三个框架、MFU 拆解、checkpoint、容错、稳定性与数据。每一篇都在回答”出了某件事该怎么办”。本篇回答的是前面那半句——怎么知道出了事,以及知道之后的十分钟里该看哪里、该叫谁、该按什么顺序查。 这不是一个附加题。Llama 3 论文(Dubey et al. 2024)报告的 54 天里 419 次意外中断,平均每三小时一次;同一篇论文说他们只有 3 次需要显著的人工介入,有效...

大规模训练工程(07):训练稳定性与数据管线——loss spike、梯度范数、数据混合与流式加载

Training Stability and the Data Pipeline

更新 @2026-09-06:本文 torchtitan 部分基于 v0.3.0 刷新;其余源码引用仍以 PyTorch 2.13.0 / Megatron Core 0.18.0 / DeepSpeed 0.19.2 为准。 前两篇处理的敌人是硬件:卡会坏、网会断、算出来的结果会悄悄错。这一篇的敌人不报错、不掉卡、不超时——任务好好地跑着,第 137,000 步 loss 从 2.1 跳到 4.8,梯度范数从 0.3 蹿到 40,然后要么在几百步后慢慢爬回来,要么再也回不来。PaLM 论文(Chowdhery et al. 2022)报告 540B 模型的训练中出现了大约 20 次这样的 spike;OLMo 2 的技术报告用了整整一节讲他们怎么把它压下...

大规模训练工程(06):容错与弹性——故障率数学、straggler、SDC 与弹性训练

Fault Tolerance and Elasticity: Failure Math, Stragglers, SDC and Elastic Training

更新 @2026-09-06:本文 torchft 部分基于 v0.2.0、torchtitan 部分基于 v0.3.0 刷新;其余源码引用仍以 PyTorch 2.13.0 / Megatron Core 0.18.0 / NVIDIA Resiliency Extension 0.6.0 为准。 Llama 3 论文(Dubey et al. 2024,The Llama 3 Herd of Models)第 3.3.4 节给了一组很少有训练团队愿意公开的数字:405B 模型在 16K 张 H100 上预训练,54 天的统计窗口里发生了 466 次任务中断,其中 47 次是计划内的(固件升级、数据集切换),419 次是意外的;意外中断里约 78% 归因...

大规模训练工程(05):分布式 checkpoint——格式、异步保存与重分片恢复

Distributed Checkpoint: Format, Async Save and Resharding

更新 @2026-09-06:本文 torchtitan 部分基于 v0.3.0 刷新;其余源码引用仍以 PyTorch 2.13.0 / Megatron Core 0.18.0 / DeepSpeed 0.19.2 为准。 前四篇解决的是”怎么配、怎么跑满”。配置定了、MFU 到了预期,任务开始按一个月的日程往前跑。这时候训练引擎面对的第一个可靠性问题不是故障本身,而是一个更朴素的问题:这一千多 GB 到几 TB 的状态,怎么写到磁盘上,写多久一次,写的时候要不要停。 Llama 3 论文(Dubey et al. 2024)给了一组值得反复引用的数字:16K 张 H100、54 天预训练、466 次任务中断,其中 419 次是意外的。折算下来集群平...

×