系列文章
成体系地读:按学习地图组织,地图 → 系列 → 单篇,点开一层即可展开AI 算法工程师学习地图11 个系列 · 101 篇地图 ›
-
01 算法工程师的数学:读公式不卡壳的最小集 9 篇
- 算法工程师的数学:读公式不卡壳的最小集(总纲)总览
- 向量、矩阵与形状——一个 token 过一层要算多少2026-01-08
- 内积、范数与余弦相似度2026-01-09
- 正交与旋转、特征值与 SVD——从 RoPE 到 LoRA2026-01-10
- 概率入门——语言模型是一个条件分布2026-01-11
- 从最大似然到交叉熵——第一个要会推的 loss2026-01-12
- 熵、交叉熵与 KL——从困惑度到 DPO2026-01-13
- 导数、梯度与链式法则——softmax 的梯度与策略梯度2026-01-14
- 统计推断与拟合——评测的置信区间与 scaling law2026-01-15
- 系列总结与通关自测2026-01-15
-
02 算法工程师的工具箱:从一个想法到一次能跑的实验 7 篇
- 算法工程师的工具箱:从一个想法到一次能跑的实验(总纲)总览
- Python 使用层——读懂训练代码的语法、流式过一遍语料、把实验写成脚本2026-01-17
- 数据科学三剑客——NumPy 的形状直觉、Pandas 的错误分析、Matplotlib 的曲线2026-01-18
- PyTorch 使用层(上)——五个对象与二十行训练循环2026-01-19
- PyTorch 使用层(下)——混合精度、显存的账与多卡启用2026-01-20
- Hugging Face 生态——六个库与一次 LoRA SFT 的组装2026-01-21
- GPU 直觉与实验管理——两个上限、四块显存、能复现2026-01-22
- 系列总结与通关自测2026-01-22
-
03 LLM 时代的经典机器学习:只讲它在哪里重现 11 篇
- LLM 时代还要学经典机器学习吗:只讲它在哪里重现(总纲)总览
- 什么是学习——划分、泛化、过拟合与偏差-方差2026-02-28
- 线性回归——最小二乘、梯度下降与 Ridge / Lasso2026-03-01
- 逻辑回归与奖励模型——每个分类头的原型2026-03-02
- 三个基础分类器——朴素贝叶斯、KNN 与决策树2026-03-03
- SVM 与核方法——最大间隔、核技巧与 attention 的远亲2026-03-04
- 集成——随机森林、梯度提升与数据质量分类器的算力账2026-03-05
- 聚类——K-Means、DBSCAN 与「这批语料里有什么」2026-03-06
- 降维——PCA、SVD、t-SNE 与 embedding 的各向异性2026-03-07
- 去重——MinHash 与 LSH 的概率2026-03-08
- 评估——从混淆矩阵到 judge 的一致性2026-03-09
- 系列总结与通关自测2026-03-09
-
04 深度学习基础:从反向传播到残差 7 篇
- 深度学习基础:从反向传播到残差(总纲)总览
- 反向传播——手推一个两层网络2026-03-24
- 训练为什么不稳定——初始化、归一化与残差2026-03-25
- 优化器——从 SGD 到 AdamW 与学习率调度2026-03-26
- 正则化与泛化——为什么参数比样本多却不过拟合2026-03-27
- CNN——从 LeNet 到 ResNet,再到 ViT2026-03-28
- RNN——从 LSTM 到 attention 的诞生2026-03-29
- 系列总结与通关自测2026-03-29
-
05 预训练:从 tokenizer 到训练配方 5 篇
- 预训练:从 tokenizer 到训练配方(总纲)总览
- 分词与词表:BPE、词表大小与 token 效率2026-04-10
- Scaling law:从 Chinchilla 到"过训练",算力怎么分给参数与数据2026-04-11
- 预训练数据工程:从 Common Crawl 到 15T token,去重、过滤与配比的账2026-04-12
- 训练配方与稳定性:学习率、batch、调度与 loss spike2026-04-13
- 系列总结与通关自测2026-04-13
-
06 后训练:从 SFT 到可验证奖励 9 篇
- 后训练:从 SFT 到可验证奖励(总纲)总览
- SFT:指令数据、chat template、loss mask 与参数高效微调2026-04-16
- 偏好数据与奖励模型:Bradley-Terry、pairwise loss 与 reward hacking2026-04-17
- 在线 RL:PPO、GRPO 与 RLHF 三件套2026-04-18
- 离线 RL:从 RLHF 目标推出 DPO 及其变体2026-04-19
- 推理模型与可验证奖励:R1 的配方、PRM 与 test-time compute2026-04-20
- Agent 与工具调用的 RL:多轮环境、轨迹数据与延后的奖励2026-04-21
- 蒸馏:logits 级、序列级与 on-policy2026-04-22
- 评测:benchmark、LLM-as-judge、Arena 与污染2026-04-23
- 系列总结与通关自测2026-04-23
-
07 高效推理与压缩(算法侧):解码、投机、量化与 KV 7 篇
- 高效推理与压缩(算法侧):解码、投机、量化与 KV(总纲)总览
- 解码策略、采样与约束生成2026-04-26
- 投机解码:草稿、接受率与树2026-04-27
- 训练后量化:误差模型、GPTQ、AWQ 与旋转2026-04-28
- 量化感知训练、低比特与量化模型的评测2026-04-29
- KV cache 压缩:量化、驱逐与稀疏 attention2026-04-30
- 剪枝、深度缩放与小模型配方2026-05-01
- 系列总结与通关自测2026-05-01
-
08 多模态:从视觉编码器到扩散模型 10 篇
- 多模态:从视觉编码器到扩散模型(总纲)总览
- 视觉编码器:CLIP、SigLIP 与自监督 ViT2026-05-03
- VLM 的结构:connector、注入方式与动态分辨率2026-05-04
- VLM 的训练:数据、阶段与评测2026-05-05
- 语音(上):从波形到 token——mel 谱、Whisper 与神经 codec2026-05-06
- 语音(下):语音理解、语音生成与全双工2026-05-06
- 扩散模型(上):DDPM——加噪、去噪与「预测噪声」2026-05-07
- 扩散模型(下):score matching、flow matching 与 classifier-free guidance2026-05-07
- Latent diffusion、DiT 与文生图配方2026-05-08
- 自回归图像生成与统一模型2026-05-09
- 系列总结与通关自测2026-05-09
-
共享 Python 在 AI-Infra:从语言机制到生产交付 11 篇
- Python 在 AI-Infra:从语言机制到生产交付(总纲)总览
- 代码如何被执行——执行模型、作用域、导入与异常2026-01-24
- 对象如何工作——对象模型、协议、装饰器与生成器2026-01-24
- 类型系统——类型表达与 typing 工具箱2026-01-25
- 类型系统——类型信息的分发与消费2026-01-25
- 类型系统——数据契约设计2026-01-25
- 并发、异步与任务协作2026-01-26
- Python的动态机制及工程实践2026-01-27
- 内存管理与优化2026-01-28
- 单元测试、问题定位与调试实践2026-01-29
- 项目工程化与生产交付2026-01-30
- 系列总结与通关自测2026-01-30
-
共享 PyTorch 深度实践:从 Tensor 到深度学习运行时 11 篇
- PyTorch 深度实践:从 Tensor 到深度学习运行时(总纲)总览
- PyTorch 整体介绍2026-02-17
- Tensor 与内存布局2026-02-18
- 自动求导与动态计算图2026-02-19
- nn.Module 与训练系统2026-02-20
- Dispatcher 与算子系统2026-02-21
- C++ 扩展与自定义算子2026-02-22
- 编译执行与图优化2026-02-23
- 性能优化与调试2026-02-24
- 分布式 PyTorch2026-02-25
- PyTorch 的工程体系——一次改动如何安全地到达用户2026-02-26
- 系列总结与通关自测2026-02-26
-
共享 Transformer 与 LLM:结构、实现与算量 14 篇
- Transformer 与 LLM:结构、实现与算量(总纲)总览
- Transformer 长什么样——从一句话到下一个 token2026-03-30
- 一个 token 的旅程——训练侧与推理侧2026-03-31
- 手搓 GPT(上)——nanoGPT model.py 逐行解析2026-03-31
- 手搓 GPT(下)——nanoGPT train.py 与训一个会续写的模型2026-04-01
- Transformer 解剖与参数量2026-04-02
- Attention 变体与 KV cache2026-04-03
- 位置编码与长上下文2026-04-04
- MoE 的路由、激活参数量与通信形态2026-04-05
- MTP——改训练目标而不改主干的多 token 预测2026-04-05
- 前向的算量与访存量2026-04-06
- 浮点格式、数值稳定性与混合精度2026-04-07
- 量化、投机解码与 LoRA2026-04-08
- 多模态:vision encoder 的算量与 image token 的 KV 代价2026-04-08
- Transformer 与 LLM:系列总结与通关自测2026-04-09
AI-Infra 工程师学习地图13 个系列 · 123 篇地图 ›
-
01 Python 在 AI-Infra:从语言机制到生产交付 11 篇
- Python 在 AI-Infra:从语言机制到生产交付(总纲)总览
- 代码如何被执行——执行模型、作用域、导入与异常2026-01-24
- 对象如何工作——对象模型、协议、装饰器与生成器2026-01-24
- 类型系统——类型表达与 typing 工具箱2026-01-25
- 类型系统——类型信息的分发与消费2026-01-25
- 类型系统——数据契约设计2026-01-25
- 并发、异步与任务协作2026-01-26
- Python的动态机制及工程实践2026-01-27
- 内存管理与优化2026-01-28
- 单元测试、问题定位与调试实践2026-01-29
- 项目工程化与生产交付2026-01-30
- 系列总结与通关自测2026-01-30
-
02 C++ 在 AI-Infra:从对象模型到算子扩展 10 篇
- C++ 在 AI-Infra:从对象模型到算子扩展(总纲)总览
- 编译模型——从一个 .cpp 到可加载的 .so2026-02-04
- 工程布局——命名空间、库的分层与 CMake2026-02-04
- 值、引用与所有权——对象模型与 RAII2026-02-06
- 模板与泛型编程2026-02-07
- 多态与类型擦除——运行时如何选择实现2026-02-08
- 宏、静态注册与代码生成2026-02-10
- 并发、内存模型、TLS 与守卫2026-02-12
- 与 Python 之间——pybind11、Python C API 与 ABI2026-02-14
- 构建、调试与测试工具链2026-02-15
- 系列总结与通关自测2026-02-15
-
03 PyTorch 深度实践:从 Tensor 到深度学习运行时 11 篇
- PyTorch 深度实践:从 Tensor 到深度学习运行时(总纲)总览
- PyTorch 整体介绍2026-02-17
- Tensor 与内存布局2026-02-18
- 自动求导与动态计算图2026-02-19
- nn.Module 与训练系统2026-02-20
- Dispatcher 与算子系统2026-02-21
- C++ 扩展与自定义算子2026-02-22
- 编译执行与图优化2026-02-23
- 性能优化与调试2026-02-24
- 分布式 PyTorch2026-02-25
- PyTorch 的工程体系——一次改动如何安全地到达用户2026-02-26
- 系列总结与通关自测2026-02-26
-
04 Transformer 与 LLM:结构、实现与算量 14 篇
- Transformer 与 LLM:结构、实现与算量(总纲)总览
- Transformer 长什么样——从一句话到下一个 token2026-03-30
- 一个 token 的旅程——训练侧与推理侧2026-03-31
- 手搓 GPT(上)——nanoGPT model.py 逐行解析2026-03-31
- 手搓 GPT(下)——nanoGPT train.py 与训一个会续写的模型2026-04-01
- Transformer 解剖与参数量2026-04-02
- Attention 变体与 KV cache2026-04-03
- 位置编码与长上下文2026-04-04
- MoE 的路由、激活参数量与通信形态2026-04-05
- MTP——改训练目标而不改主干的多 token 预测2026-04-05
- 前向的算量与访存量2026-04-06
- 浮点格式、数值稳定性与混合精度2026-04-07
- 量化、投机解码与 LoRA2026-04-08
- 多模态:vision encoder 的算量与 image token 的 KV 代价2026-04-08
- Transformer 与 LLM:系列总结与通关自测2026-04-09
-
05 GPU Kernel 工程:从 CUDA 执行模型到 FlashAttention 11 篇
- GPU Kernel 工程:从 CUDA 执行模型到 FlashAttention(总纲)总览
- GPU 为什么这样设计——硬件结构与 Roofline2026-05-11
- CUDA 编程模型与第一个 kernel2026-05-12
- 访存合并与 elementwise kernel2026-05-13
- 共享内存与 reduction——softmax、LayerNorm 与 online softmax2026-05-14
- GEMM——从 naive 到分块2026-05-15
- Tensor Core、CUTLASS 与 CuTe2026-05-16
- Triton——块级编程与编译器的边界2026-05-17
- Attention Kernel——FlashAttention 与 PagedAttention2026-05-18
- 量化与融合 kernel——推理系统的其余部分2026-05-19
- 剖析、测试与贡献——把 kernel 做成产品2026-05-20
- 系列总结与通关自测2026-05-20
-
06 通信与互联:从 NCCL 到 RDMA 9 篇
- 通信与互联:从 NCCL 到 RDMA(总纲)总览
- 集合通信原语与代价模型——α-β 模型与 ring all-reduce2026-06-03
- 硬件互联——PCIe、NVLink、NVSwitch 与网络拓扑2026-06-06
- RDMA 与 GPUDirect——绕过 CPU 和主机内存的数据通路2026-06-10
- NCCL 架构——拓扑探测、channel、算法与协议2026-06-13
- PyTorch 的通信栈——ProcessGroupNCCL、stream 语义与计算通信重叠2026-06-17
- nccl-tests、调优与排障——从带宽曲线到 hang2026-06-20
- 推理侧的通信——custom all-reduce 与 KV 传输2026-06-24
- MoE 的通信——all-to-all、DeepEP 与 GPU 发起的通信2026-06-27
- 系列总结与通关自测2026-06-27
-
07 大规模训练工程:从并行策略到容错恢复 9 篇
- 大规模训练工程:从并行策略到容错恢复(总纲)总览
- 训练任务的状态解剖——显存账与 MFU2026-07-15
- 并行策略全景——每种并行切的是哪种状态2026-07-17
- 三个框架——Megatron-LM、DeepSpeed 与 torchtitan 的架构对比与源码导读2026-07-19
- 千卡配置实战——并行搭配、micro-batch、激活重计算与 MFU 调优2026-07-21
- 分布式 checkpoint——格式、异步保存与重分片恢复2026-07-23
- 容错与弹性——故障率数学、straggler、SDC 与弹性训练2026-07-25
- 训练稳定性与数据管线——loss spike、梯度范数、数据混合与流式加载2026-07-27
- 长时训练的可观测与运维——从指标到 hang 排查2026-07-29
- 系列总结与通关自测2026-07-29
-
08 大模型推理系统揭秘:从 vLLM 看 LLM Serving Infra 核心技术 15 篇
- 大模型推理系统揭秘:从 vLLM 看 LLM Serving Infra 核心技术(总纲)总览
- 为什么 LLM Serving 比传统 DL 推理难?2026-08-12
- 如何衡量一个 LLM Serving 系统?2026-08-13
- 鸟瞰 vLLM:一个请求如何穿过整个推理系统?2026-08-14
- Scheduler:GPU 这一轮到底给谁用?2026-08-15
- KV Cache:LLM Serving 的第一号内存问题2026-08-16
- GPU 执行:如何让每个 Token 算得更快?2026-08-17
- 解码的扩展:采样、投机解码与结构化输出2026-08-18
- Multi-GPU:一张卡不够时如何扩展?2026-08-19
- 模型适配:如何跟上变化极快的模型世界?2026-08-20
- 请求形态的扩展:multi-LoRA 与多模态2026-08-21
- 硬件解耦:如何不让芯片差异污染 Serving 核心?2026-08-22
- PD 分离:从资源混部走向计算解耦2026-08-23
- Serving Infra 的下一站:从模型执行器到分布式智能操作系统2026-08-24
- 回到源码:一次请求在 vLLM 内部的真实旅程2026-08-25
- 系列总结与通关自测2026-08-25
-
09 RL 后训练基础设施:rollout 与训练如何共享一组 GPU 9 篇
- RL 后训练基础设施:rollout 与训练如何共享一组 GPU(总纲)总览
- 负载画像——一步 RL 里发生什么2026-08-27
- 系统形态——共置、分离与异步2026-08-28
- 共置——训练器与推理引擎在同一组 GPU 上共存2026-08-29
- 权重同步——从训练分片到推理分片2026-08-30
- 异步与 off-policy——把同步的墙拆掉之后要补什么2026-08-31
- Agentic rollout——多轮、工具、沙箱与环境服务2026-09-01
- verl 源码导读——从一个 GRPO 配置追到每个 worker2026-09-02
- 配置、可观测与排障——从一张卡的比例到一条 hang 的排查2026-09-03
- 系列总结与通关自测2026-09-03
-
10 扩散模型推理基础设施:从一次去噪到一个生成服务 10 篇
- 扩散模型推理基础设施:图像与视频生成的 serving(总纲)总览
- 负载画像——一次生成在 GPU 上发生什么2026-09-05
- 单卡执行——attention 后端、编译、FP8 / INT4 与 offload2026-09-06
- 跨步冗余——TeaCache、First-Block Cache 一族的缓存与跳步2026-09-07
- 视频——长序列 attention 的账与稀疏化2026-09-08
- 多卡并行——序列并行、CFG 并行与 PipeFusion,为什么不是张量并行2026-09-09
- 少步与自回归——把步数变成系统参数2026-09-10
- serving 形态——请求、批、三段分离、附件、异步任务与成本2026-09-11
- 三个引擎的对照导读——同一张图的请求在 SGLang Diffusion、vLLM-Omni 与 xDiT 里各走过什么2026-09-12
- 配置、评测与排障——从一张卡的推导到一条伪影的排查2026-09-13
- 系列总结与通关自测2026-09-13
-
11 AI 平台工程:资源层与交付层 9 篇
- AI 平台工程:资源层与交付层(总纲)总览
- 引擎的需求清单与平台的整体架构2026-09-15
- 容器里的 GPU——驱动、CUDA、device plugin 与镜像2026-09-16
- AI 任务调度——gang scheduling、队列与拓扑感知2026-09-17
- GPU 共享与切分——MIG、时间片、MPS 与 HAMi2026-09-18
- 网络与存储——RDMA 进容器、并行文件系统与 checkpoint I/O2026-09-19
- Serving 平台——从 InferenceService 到 llm-d2026-09-20
- 模型网关与多租户——路由、配额与灰度2026-09-21
- 可观测、成本与 FinOps2026-09-22
- 系列总结与通关自测2026-09-22
-
12 AI-Infra 开源贡献指南 5 篇
- AI-Infra 开源贡献指南(总纲)总览
- 读懂一个百万行的代码库2026-09-24
- 找到切入点——从 issue、RFC 到性能回归2026-09-25
- 做出一个能被合入的改动2026-09-26
- 两个真实 PR 的完整走读——PyTorch 与 vLLM2026-09-27
- 系列总结与通关自测2026-09-27
-
13 ML 编译器内部:从 SSA、MLIR 到 Triton 编译器 即将发布 · 14 篇
AI 应用工程师学习地图7 个系列 · 0 篇地图 ›
-
01 模型作为组件:契约、失效模式与选型 即将发布 · 7 篇
-
02 Prompt 与上下文工程:模型这一步该看到什么 即将发布 · 7 篇
-
03 检索与知识接入:私域知识怎么进入模型 即将发布 · 8 篇
-
04 工具、Agent 与 harness:模型怎么从回答变成做事 即将发布 · 10 篇
-
05 评测、可观测与可追溯:怎么知道改了之后更好了 即将发布 · 8 篇
-
06 生产化与运营:让 AI 应用可靠、可控、可持续地跑 即将发布 · 8 篇
-
07 产品与体验:把不确定的能力做成可信的产品 即将发布 · 6 篇
其他系列1 个系列
-
面试手撕代码:从 LeetCode 中等题到 Transformer 组件 20 篇
- 面试手撕代码:从 LeetCode 中等题到 Transformer 组件(总纲)总览
- 数组、哈希与前缀和2025-12-02
- 双指针与滑动窗口2025-12-03
- 栈、单调栈与单调队列2025-12-04
- 链表2025-12-05
- 二叉树2025-12-06
- 图——BFS / DFS / 拓扑排序 / 并查集 / 最短路2025-12-07
- 二分——只有一个模板2025-12-08
- 堆、Top-K、区间与贪心2025-12-09
- 回溯2025-12-10
- 字符串2025-12-11
- 动态规划(一)——线性与二维2025-12-12
- 动态规划(二)——背包、区间、状态机、树形2025-12-13
- 设计题与数据结构实现2025-12-14
- 手撕 attention 家族2025-12-15
- 手撕 Transformer block 与反向传播2025-12-16
- 手撕 tokenizer 与解码2025-12-17
- 手撕损失函数与训练算法2025-12-18
- 手撕经典 ML 与评测指标2025-12-19
- Infra 岗手撕——并发与系统2025-12-20
- 系列总结与通关自测2025-12-20