Toggle navigation
Arganzheng's Blog
Posts
Slides
Archive
Search
Tags
About
Arganzheng's Blog
stay hungry, stay foolish
大模型推理系统揭秘:从 vLLM 看 LLM Serving Infra 核心技术(目录)
原文内容较长,现已按章节拆分为独立文章,便于分段阅读与分享。 NOTE 本系列基于 vLLM v0.27.1(tag 6e448d0, 2026-08-11)源码深度剖析。文中所有文件路径、类名和行号均以该版本为准;vLLM 迭代很快,阅读时请以你手上的版本对照。 目录 为什么 LLM Serving 比传统 DL 推理难? 如何衡量一个 LLM Serving 系统...
Posted by
arganzheng
| August 15, 2026
大模型推理系统揭秘(12):回到源码:一次请求在 vLLM 内部的真实旅程
NOTE 本文基于 vLLM v0.27.1(tag 6e448d0, 2026-08-11)源码深度剖析。文中所有文件路径、类名和行号均以该版本为准;vLLM 迭代很快,阅读时请以你手上的版本对照。 前九章回答了「是什么」和「为什么」,这一章回答「怎么实现」。 现在你已经知道 Scheduler 为什么要按 token 预算调度、KV Cache 为什么要分块、Atte...
Posted by
arganzheng
| August 15, 2026
大模型推理系统揭秘(11):Serving Infra 的下一站:从模型执行器到分布式智能操作系统
NOTE 本文基于 vLLM v0.27.1(tag 6e448d0, 2026-08-11)源码深度剖析。文中所有文件路径、类名和行号均以该版本为准;vLLM 迭代很快,阅读时请以你手上的版本对照。 在前面的章节中,我们围绕 vLLM 的核心机制展开了讨论:模型如何加载,算子如何执行,请求如何调度,以及 KV Cache 如何管理。 这些机制解决的是一个核心问题: 如何...
Posted by
arganzheng
| August 15, 2026
大模型推理系统揭秘(10):PD 分离:从单机 Serving 走向集群 Serving
NOTE 本文基于 vLLM v0.27.1(tag 6e448d0, 2026-08-11)源码深度剖析。文中所有文件路径、类名和行号均以该版本为准;vLLM 迭代很快,阅读时请以你手上的版本对照。 本章把前面讨论的四个问题从单机推向集群:当 Prefill 和 Decode 不再共享同一批 GPU,调度、KV Cache、路由和故障恢复都需要重新设计。 前八章主要讨论...
Posted by
arganzheng
| August 15, 2026
大模型推理系统揭秘(09):硬件解耦:如何不让芯片差异污染 Serving 核心?
NOTE 本文基于 vLLM v0.27.1(tag 6e448d0, 2026-08-11)源码深度剖析。文中所有文件路径、类名和行号均以该版本为准;vLLM 迭代很快,阅读时请以你手上的版本对照。 上一章讨论了模型适配:面对不断变化的模型结构,Serving 框架如何通过统一接口、模型注册和模块化执行路径,降低新模型接入成本。 但模型只是变化来源之一。 在真实部署环境中,硬...
Posted by
arganzheng
| August 15, 2026
大模型推理系统揭秘(08):模型适配:如何跟上变化极快的模型世界?
NOTE 本文基于 vLLM v0.27.1(tag 6e448d0, 2026-08-11)源码深度剖析。文中所有文件路径、类名和行号均以该版本为准;vLLM 迭代很快,阅读时请以你手上的版本对照。 1. 痛点:为什么推理引擎必须持续适配新模型? 1.1 模型算法同质化与工程实现异构化 LLM 模型在算法上高度同质,都是基于 Transformer模型,围绕以下组件构建: ...
Posted by
arganzheng
| August 15, 2026
大模型推理系统揭秘(07):Multi-GPU:一张卡不够时如何扩展?
NOTE 本文基于 vLLM v0.27.1(tag 6e448d0, 2026-08-11)源码深度剖析。文中所有文件路径、类名和行号均以该版本为准;vLLM 迭代很快,阅读时请以你手上的版本对照。 1. 分布式推理的混合并行策略 分布式推理的混合并行策略: 遇到的问题 该用的策略 切的是什么 ...
Posted by
arganzheng
| August 15, 2026
大模型推理系统揭秘(06):GPU 执行:如何让每个 Token 算得更快?
NOTE 本文基于 vLLM v0.27.1(tag 6e448d0, 2026-08-11)源码深度剖析。文中所有文件路径、类名和行号均以该版本为准;vLLM 迭代很快,阅读时请以你手上的版本对照。 这一章的问题是:这些已经确定要算的 token,怎么算得更快。 Decode 偏 memory-bound、Prefill 偏 compute-bound,但落到 GPU 上,浪费...
Posted by
arganzheng
| August 15, 2026
大模型推理系统揭秘(05):KV Cache:LLM Serving 的第一号内存问题
NOTE 本文基于 vLLM v0.27.1(tag 6e448d0, 2026-08-11)源码深度剖析。文中所有文件路径、类名和行号均以该版本为准;vLLM 迭代很快,阅读时请以你手上的版本对照。 设想一个场景: 你有一张 80 GB 的卡,同时来了 100 个请求。第一个请求最后只生成了 300 个 token,第二个生成了 3000 个,第三个一路写到 20K。问题在于:...
Posted by
arganzheng
| August 15, 2026
大模型推理系统揭秘(04):Scheduler:GPU 这一轮到底给谁用?
NOTE 本文基于 vLLM v0.27.1(tag 6e448d0, 2026-08-11)源码深度剖析。文中所有文件路径、类名和行号均以该版本为准;vLLM 迭代很快,阅读时请以你手上的版本对照。 前面我们已经解决了一个重要问题: KV Cache 如何管理? PagedAttention 将 KV Cache 从连续的大块显存变成可以按 Block 动态分配和回收...
Posted by
arganzheng
| August 15, 2026
Older Posts →
ABOUT ME
天造之才,皆有其用。
振翅高飞,无须在梦中。
知
TAGS CLOUD
c
2
c++
2
BDB
7
database
16
transaction
4
groovy
1
DSL
1
SpringMVC
5
安全
1
java
32
操作系统
1
编程语言
1
perl
1
shell
6
linux
7
productivity
4
jekyll
3
博客
2
spring
15
quartz
1
junit
2
ant
2
maven
6
spring-security
1
tomcat
4
debug
1
jvm
4
mysql
9
aop
1
proxy
1
cglib
1
mina
1
nio
1
网络编程
1
btrace
1
rpc
1
scala
1
architecture
1
classloader
1
zookeeper
2
分布式锁
1
http
1
cache
1
log4j
2
redis
7
消息队列
4
nginx
7
elasticsearch
12
移动互联网
1
uuid
1
dns
1
standalone
1
performance tuning
1
replication
1
高可用
2
分布式
4
缓存
2
kafka
3
广告
1
git
3
高并发
1
过载保护
1
图数据库
8
neo4j
5
存储
1
aerospike
3
Titan
1
Bloom filter
1
生活
2
markdown
1
kramdown
1
瑜伽
1
呼吸
1
生活的艺术
1
UDF
1
antlr
1
parser
1
感恩节
1
puppeteer
1
chrome-headless
1
crawler
1
cluster
2
monitor
1
k8s
1
docker
1
concurrency
2
微服务
2
架构
3
AI
14
spark
6
hadoop
2
log4j2
1
RDD
1
shuffle
1
data skew
1
agile
2
gitlab
1
high performance
2
tunning
1
机器学习
2
特征工程
1
Parameter Server
1
埋点
1
TDD
1
敏捷
1
AI-infra
13
大模型推理
13
RECOMMEND
美团技术团队
Jay Alammar
Eugene Yan
deeplearning.ai