系列文章

成体系地读:按学习地图组织,地图 → 系列 → 单篇,点开一层即可展开
AI 算法工程师学习地图11 个系列 · 101 篇地图 ›
  1. 01 算法工程师的数学:读公式不卡壳的最小集 9 篇
    1. 算法工程师的数学:读公式不卡壳的最小集(总纲)总览
    2. 向量、矩阵与形状——一个 token 过一层要算多少2026-01-08
    3. 内积、范数与余弦相似度2026-01-09
    4. 正交与旋转、特征值与 SVD——从 RoPE 到 LoRA2026-01-10
    5. 概率入门——语言模型是一个条件分布2026-01-11
    6. 从最大似然到交叉熵——第一个要会推的 loss2026-01-12
    7. 熵、交叉熵与 KL——从困惑度到 DPO2026-01-13
    8. 导数、梯度与链式法则——softmax 的梯度与策略梯度2026-01-14
    9. 统计推断与拟合——评测的置信区间与 scaling law2026-01-15
    10. 系列总结与通关自测2026-01-15
  2. 02 算法工程师的工具箱:从一个想法到一次能跑的实验 7 篇
    1. 算法工程师的工具箱:从一个想法到一次能跑的实验(总纲)总览
    2. Python 使用层——读懂训练代码的语法、流式过一遍语料、把实验写成脚本2026-01-17
    3. 数据科学三剑客——NumPy 的形状直觉、Pandas 的错误分析、Matplotlib 的曲线2026-01-18
    4. PyTorch 使用层(上)——五个对象与二十行训练循环2026-01-19
    5. PyTorch 使用层(下)——混合精度、显存的账与多卡启用2026-01-20
    6. Hugging Face 生态——六个库与一次 LoRA SFT 的组装2026-01-21
    7. GPU 直觉与实验管理——两个上限、四块显存、能复现2026-01-22
    8. 系列总结与通关自测2026-01-22
  3. 03 LLM 时代的经典机器学习:只讲它在哪里重现 11 篇
    1. LLM 时代还要学经典机器学习吗:只讲它在哪里重现(总纲)总览
    2. 什么是学习——划分、泛化、过拟合与偏差-方差2026-02-28
    3. 线性回归——最小二乘、梯度下降与 Ridge / Lasso2026-03-01
    4. 逻辑回归与奖励模型——每个分类头的原型2026-03-02
    5. 三个基础分类器——朴素贝叶斯、KNN 与决策树2026-03-03
    6. SVM 与核方法——最大间隔、核技巧与 attention 的远亲2026-03-04
    7. 集成——随机森林、梯度提升与数据质量分类器的算力账2026-03-05
    8. 聚类——K-Means、DBSCAN 与「这批语料里有什么」2026-03-06
    9. 降维——PCA、SVD、t-SNE 与 embedding 的各向异性2026-03-07
    10. 去重——MinHash 与 LSH 的概率2026-03-08
    11. 评估——从混淆矩阵到 judge 的一致性2026-03-09
    12. 系列总结与通关自测2026-03-09
  4. 04 深度学习基础:从反向传播到残差 7 篇
    1. 深度学习基础:从反向传播到残差(总纲)总览
    2. 反向传播——手推一个两层网络2026-03-24
    3. 训练为什么不稳定——初始化、归一化与残差2026-03-25
    4. 优化器——从 SGD 到 AdamW 与学习率调度2026-03-26
    5. 正则化与泛化——为什么参数比样本多却不过拟合2026-03-27
    6. CNN——从 LeNet 到 ResNet,再到 ViT2026-03-28
    7. RNN——从 LSTM 到 attention 的诞生2026-03-29
    8. 系列总结与通关自测2026-03-29
  5. 05 预训练:从 tokenizer 到训练配方 5 篇
    1. 预训练:从 tokenizer 到训练配方(总纲)总览
    2. 分词与词表:BPE、词表大小与 token 效率2026-04-10
    3. Scaling law:从 Chinchilla 到"过训练",算力怎么分给参数与数据2026-04-11
    4. 预训练数据工程:从 Common Crawl 到 15T token,去重、过滤与配比的账2026-04-12
    5. 训练配方与稳定性:学习率、batch、调度与 loss spike2026-04-13
    6. 系列总结与通关自测2026-04-13
  6. 06 后训练:从 SFT 到可验证奖励 9 篇
    1. 后训练:从 SFT 到可验证奖励(总纲)总览
    2. SFT:指令数据、chat template、loss mask 与参数高效微调2026-04-16
    3. 偏好数据与奖励模型:Bradley-Terry、pairwise loss 与 reward hacking2026-04-17
    4. 在线 RL:PPO、GRPO 与 RLHF 三件套2026-04-18
    5. 离线 RL:从 RLHF 目标推出 DPO 及其变体2026-04-19
    6. 推理模型与可验证奖励:R1 的配方、PRM 与 test-time compute2026-04-20
    7. Agent 与工具调用的 RL:多轮环境、轨迹数据与延后的奖励2026-04-21
    8. 蒸馏:logits 级、序列级与 on-policy2026-04-22
    9. 评测:benchmark、LLM-as-judge、Arena 与污染2026-04-23
    10. 系列总结与通关自测2026-04-23
  7. 07 高效推理与压缩(算法侧):解码、投机、量化与 KV 7 篇
    1. 高效推理与压缩(算法侧):解码、投机、量化与 KV(总纲)总览
    2. 解码策略、采样与约束生成2026-04-26
    3. 投机解码:草稿、接受率与树2026-04-27
    4. 训练后量化:误差模型、GPTQ、AWQ 与旋转2026-04-28
    5. 量化感知训练、低比特与量化模型的评测2026-04-29
    6. KV cache 压缩:量化、驱逐与稀疏 attention2026-04-30
    7. 剪枝、深度缩放与小模型配方2026-05-01
    8. 系列总结与通关自测2026-05-01
  8. 08 多模态:从视觉编码器到扩散模型 10 篇
    1. 多模态:从视觉编码器到扩散模型(总纲)总览
    2. 视觉编码器:CLIP、SigLIP 与自监督 ViT2026-05-03
    3. VLM 的结构:connector、注入方式与动态分辨率2026-05-04
    4. VLM 的训练:数据、阶段与评测2026-05-05
    5. 语音(上):从波形到 token——mel 谱、Whisper 与神经 codec2026-05-06
    6. 语音(下):语音理解、语音生成与全双工2026-05-06
    7. 扩散模型(上):DDPM——加噪、去噪与「预测噪声」2026-05-07
    8. 扩散模型(下):score matching、flow matching 与 classifier-free guidance2026-05-07
    9. Latent diffusion、DiT 与文生图配方2026-05-08
    10. 自回归图像生成与统一模型2026-05-09
    11. 系列总结与通关自测2026-05-09
  9. 共享 Python 在 AI-Infra:从语言机制到生产交付 11 篇
    1. Python 在 AI-Infra:从语言机制到生产交付(总纲)总览
    2. 代码如何被执行——执行模型、作用域、导入与异常2026-01-24
    3. 对象如何工作——对象模型、协议、装饰器与生成器2026-01-24
    4. 类型系统——类型表达与 typing 工具箱2026-01-25
    5. 类型系统——类型信息的分发与消费2026-01-25
    6. 类型系统——数据契约设计2026-01-25
    7. 并发、异步与任务协作2026-01-26
    8. Python的动态机制及工程实践2026-01-27
    9. 内存管理与优化2026-01-28
    10. 单元测试、问题定位与调试实践2026-01-29
    11. 项目工程化与生产交付2026-01-30
    12. 系列总结与通关自测2026-01-30
  10. 共享 PyTorch 深度实践:从 Tensor 到深度学习运行时 11 篇
    1. PyTorch 深度实践:从 Tensor 到深度学习运行时(总纲)总览
    2. PyTorch 整体介绍2026-02-17
    3. Tensor 与内存布局2026-02-18
    4. 自动求导与动态计算图2026-02-19
    5. nn.Module 与训练系统2026-02-20
    6. Dispatcher 与算子系统2026-02-21
    7. C++ 扩展与自定义算子2026-02-22
    8. 编译执行与图优化2026-02-23
    9. 性能优化与调试2026-02-24
    10. 分布式 PyTorch2026-02-25
    11. PyTorch 的工程体系——一次改动如何安全地到达用户2026-02-26
    12. 系列总结与通关自测2026-02-26
  11. 共享 Transformer 与 LLM:结构、实现与算量 14 篇
    1. Transformer 与 LLM:结构、实现与算量(总纲)总览
    2. Transformer 长什么样——从一句话到下一个 token2026-03-30
    3. 一个 token 的旅程——训练侧与推理侧2026-03-31
    4. 手搓 GPT(上)——nanoGPT model.py 逐行解析2026-03-31
    5. 手搓 GPT(下)——nanoGPT train.py 与训一个会续写的模型2026-04-01
    6. Transformer 解剖与参数量2026-04-02
    7. Attention 变体与 KV cache2026-04-03
    8. 位置编码与长上下文2026-04-04
    9. MoE 的路由、激活参数量与通信形态2026-04-05
    10. MTP——改训练目标而不改主干的多 token 预测2026-04-05
    11. 前向的算量与访存量2026-04-06
    12. 浮点格式、数值稳定性与混合精度2026-04-07
    13. 量化、投机解码与 LoRA2026-04-08
    14. 多模态:vision encoder 的算量与 image token 的 KV 代价2026-04-08
    15. Transformer 与 LLM:系列总结与通关自测2026-04-09
AI-Infra 工程师学习地图13 个系列 · 123 篇地图 ›
  1. 01 Python 在 AI-Infra:从语言机制到生产交付 11 篇
    1. Python 在 AI-Infra:从语言机制到生产交付(总纲)总览
    2. 代码如何被执行——执行模型、作用域、导入与异常2026-01-24
    3. 对象如何工作——对象模型、协议、装饰器与生成器2026-01-24
    4. 类型系统——类型表达与 typing 工具箱2026-01-25
    5. 类型系统——类型信息的分发与消费2026-01-25
    6. 类型系统——数据契约设计2026-01-25
    7. 并发、异步与任务协作2026-01-26
    8. Python的动态机制及工程实践2026-01-27
    9. 内存管理与优化2026-01-28
    10. 单元测试、问题定位与调试实践2026-01-29
    11. 项目工程化与生产交付2026-01-30
    12. 系列总结与通关自测2026-01-30
  2. 02 C++ 在 AI-Infra:从对象模型到算子扩展 10 篇
    1. C++ 在 AI-Infra:从对象模型到算子扩展(总纲)总览
    2. 编译模型——从一个 .cpp 到可加载的 .so2026-02-04
    3. 工程布局——命名空间、库的分层与 CMake2026-02-04
    4. 值、引用与所有权——对象模型与 RAII2026-02-06
    5. 模板与泛型编程2026-02-07
    6. 多态与类型擦除——运行时如何选择实现2026-02-08
    7. 宏、静态注册与代码生成2026-02-10
    8. 并发、内存模型、TLS 与守卫2026-02-12
    9. 与 Python 之间——pybind11、Python C API 与 ABI2026-02-14
    10. 构建、调试与测试工具链2026-02-15
    11. 系列总结与通关自测2026-02-15
  3. 03 PyTorch 深度实践:从 Tensor 到深度学习运行时 11 篇
    1. PyTorch 深度实践:从 Tensor 到深度学习运行时(总纲)总览
    2. PyTorch 整体介绍2026-02-17
    3. Tensor 与内存布局2026-02-18
    4. 自动求导与动态计算图2026-02-19
    5. nn.Module 与训练系统2026-02-20
    6. Dispatcher 与算子系统2026-02-21
    7. C++ 扩展与自定义算子2026-02-22
    8. 编译执行与图优化2026-02-23
    9. 性能优化与调试2026-02-24
    10. 分布式 PyTorch2026-02-25
    11. PyTorch 的工程体系——一次改动如何安全地到达用户2026-02-26
    12. 系列总结与通关自测2026-02-26
  4. 04 Transformer 与 LLM:结构、实现与算量 14 篇
    1. Transformer 与 LLM:结构、实现与算量(总纲)总览
    2. Transformer 长什么样——从一句话到下一个 token2026-03-30
    3. 一个 token 的旅程——训练侧与推理侧2026-03-31
    4. 手搓 GPT(上)——nanoGPT model.py 逐行解析2026-03-31
    5. 手搓 GPT(下)——nanoGPT train.py 与训一个会续写的模型2026-04-01
    6. Transformer 解剖与参数量2026-04-02
    7. Attention 变体与 KV cache2026-04-03
    8. 位置编码与长上下文2026-04-04
    9. MoE 的路由、激活参数量与通信形态2026-04-05
    10. MTP——改训练目标而不改主干的多 token 预测2026-04-05
    11. 前向的算量与访存量2026-04-06
    12. 浮点格式、数值稳定性与混合精度2026-04-07
    13. 量化、投机解码与 LoRA2026-04-08
    14. 多模态:vision encoder 的算量与 image token 的 KV 代价2026-04-08
    15. Transformer 与 LLM:系列总结与通关自测2026-04-09
  5. 05 GPU Kernel 工程:从 CUDA 执行模型到 FlashAttention 11 篇
    1. GPU Kernel 工程:从 CUDA 执行模型到 FlashAttention(总纲)总览
    2. GPU 为什么这样设计——硬件结构与 Roofline2026-05-11
    3. CUDA 编程模型与第一个 kernel2026-05-12
    4. 访存合并与 elementwise kernel2026-05-13
    5. 共享内存与 reduction——softmax、LayerNorm 与 online softmax2026-05-14
    6. GEMM——从 naive 到分块2026-05-15
    7. Tensor Core、CUTLASS 与 CuTe2026-05-16
    8. Triton——块级编程与编译器的边界2026-05-17
    9. Attention Kernel——FlashAttention 与 PagedAttention2026-05-18
    10. 量化与融合 kernel——推理系统的其余部分2026-05-19
    11. 剖析、测试与贡献——把 kernel 做成产品2026-05-20
    12. 系列总结与通关自测2026-05-20
  6. 06 通信与互联:从 NCCL 到 RDMA 9 篇
    1. 通信与互联:从 NCCL 到 RDMA(总纲)总览
    2. 集合通信原语与代价模型——α-β 模型与 ring all-reduce2026-06-03
    3. 硬件互联——PCIe、NVLink、NVSwitch 与网络拓扑2026-06-06
    4. RDMA 与 GPUDirect——绕过 CPU 和主机内存的数据通路2026-06-10
    5. NCCL 架构——拓扑探测、channel、算法与协议2026-06-13
    6. PyTorch 的通信栈——ProcessGroupNCCL、stream 语义与计算通信重叠2026-06-17
    7. nccl-tests、调优与排障——从带宽曲线到 hang2026-06-20
    8. 推理侧的通信——custom all-reduce 与 KV 传输2026-06-24
    9. MoE 的通信——all-to-all、DeepEP 与 GPU 发起的通信2026-06-27
    10. 系列总结与通关自测2026-06-27
  7. 07 大规模训练工程:从并行策略到容错恢复 9 篇
    1. 大规模训练工程:从并行策略到容错恢复(总纲)总览
    2. 训练任务的状态解剖——显存账与 MFU2026-07-15
    3. 并行策略全景——每种并行切的是哪种状态2026-07-17
    4. 三个框架——Megatron-LM、DeepSpeed 与 torchtitan 的架构对比与源码导读2026-07-19
    5. 千卡配置实战——并行搭配、micro-batch、激活重计算与 MFU 调优2026-07-21
    6. 分布式 checkpoint——格式、异步保存与重分片恢复2026-07-23
    7. 容错与弹性——故障率数学、straggler、SDC 与弹性训练2026-07-25
    8. 训练稳定性与数据管线——loss spike、梯度范数、数据混合与流式加载2026-07-27
    9. 长时训练的可观测与运维——从指标到 hang 排查2026-07-29
    10. 系列总结与通关自测2026-07-29
  8. 08 大模型推理系统揭秘:从 vLLM 看 LLM Serving Infra 核心技术 15 篇
    1. 大模型推理系统揭秘:从 vLLM 看 LLM Serving Infra 核心技术(总纲)总览
    2. 为什么 LLM Serving 比传统 DL 推理难?2026-08-12
    3. 如何衡量一个 LLM Serving 系统?2026-08-13
    4. 鸟瞰 vLLM:一个请求如何穿过整个推理系统?2026-08-14
    5. Scheduler:GPU 这一轮到底给谁用?2026-08-15
    6. KV Cache:LLM Serving 的第一号内存问题2026-08-16
    7. GPU 执行:如何让每个 Token 算得更快?2026-08-17
    8. 解码的扩展:采样、投机解码与结构化输出2026-08-18
    9. Multi-GPU:一张卡不够时如何扩展?2026-08-19
    10. 模型适配:如何跟上变化极快的模型世界?2026-08-20
    11. 请求形态的扩展:multi-LoRA 与多模态2026-08-21
    12. 硬件解耦:如何不让芯片差异污染 Serving 核心?2026-08-22
    13. PD 分离:从资源混部走向计算解耦2026-08-23
    14. Serving Infra 的下一站:从模型执行器到分布式智能操作系统2026-08-24
    15. 回到源码:一次请求在 vLLM 内部的真实旅程2026-08-25
    16. 系列总结与通关自测2026-08-25
  9. 09 RL 后训练基础设施:rollout 与训练如何共享一组 GPU 9 篇
    1. RL 后训练基础设施:rollout 与训练如何共享一组 GPU(总纲)总览
    2. 负载画像——一步 RL 里发生什么2026-08-27
    3. 系统形态——共置、分离与异步2026-08-28
    4. 共置——训练器与推理引擎在同一组 GPU 上共存2026-08-29
    5. 权重同步——从训练分片到推理分片2026-08-30
    6. 异步与 off-policy——把同步的墙拆掉之后要补什么2026-08-31
    7. Agentic rollout——多轮、工具、沙箱与环境服务2026-09-01
    8. verl 源码导读——从一个 GRPO 配置追到每个 worker2026-09-02
    9. 配置、可观测与排障——从一张卡的比例到一条 hang 的排查2026-09-03
    10. 系列总结与通关自测2026-09-03
  10. 10 扩散模型推理基础设施:从一次去噪到一个生成服务 10 篇
    1. 扩散模型推理基础设施:图像与视频生成的 serving(总纲)总览
    2. 负载画像——一次生成在 GPU 上发生什么2026-09-05
    3. 单卡执行——attention 后端、编译、FP8 / INT4 与 offload2026-09-06
    4. 跨步冗余——TeaCache、First-Block Cache 一族的缓存与跳步2026-09-07
    5. 视频——长序列 attention 的账与稀疏化2026-09-08
    6. 多卡并行——序列并行、CFG 并行与 PipeFusion,为什么不是张量并行2026-09-09
    7. 少步与自回归——把步数变成系统参数2026-09-10
    8. serving 形态——请求、批、三段分离、附件、异步任务与成本2026-09-11
    9. 三个引擎的对照导读——同一张图的请求在 SGLang Diffusion、vLLM-Omni 与 xDiT 里各走过什么2026-09-12
    10. 配置、评测与排障——从一张卡的推导到一条伪影的排查2026-09-13
    11. 系列总结与通关自测2026-09-13
  11. 11 AI 平台工程:资源层与交付层 9 篇
    1. AI 平台工程:资源层与交付层(总纲)总览
    2. 引擎的需求清单与平台的整体架构2026-09-15
    3. 容器里的 GPU——驱动、CUDA、device plugin 与镜像2026-09-16
    4. AI 任务调度——gang scheduling、队列与拓扑感知2026-09-17
    5. GPU 共享与切分——MIG、时间片、MPS 与 HAMi2026-09-18
    6. 网络与存储——RDMA 进容器、并行文件系统与 checkpoint I/O2026-09-19
    7. Serving 平台——从 InferenceService 到 llm-d2026-09-20
    8. 模型网关与多租户——路由、配额与灰度2026-09-21
    9. 可观测、成本与 FinOps2026-09-22
    10. 系列总结与通关自测2026-09-22
  12. 12 AI-Infra 开源贡献指南 5 篇
    1. AI-Infra 开源贡献指南(总纲)总览
    2. 读懂一个百万行的代码库2026-09-24
    3. 找到切入点——从 issue、RFC 到性能回归2026-09-25
    4. 做出一个能被合入的改动2026-09-26
    5. 两个真实 PR 的完整走读——PyTorch 与 vLLM2026-09-27
    6. 系列总结与通关自测2026-09-27
  13. 13 ML 编译器内部:从 SSA、MLIR 到 Triton 编译器 即将发布 · 14 篇
AI 应用工程师学习地图7 个系列 · 0 篇地图 ›
  1. 01 模型作为组件:契约、失效模式与选型 即将发布 · 7 篇
    1. 模型作为组件:契约、失效模式与选型(总纲)总览
  2. 02 Prompt 与上下文工程:模型这一步该看到什么 即将发布 · 7 篇
  3. 03 检索与知识接入:私域知识怎么进入模型 即将发布 · 8 篇
  4. 04 工具、Agent 与 harness:模型怎么从回答变成做事 即将发布 · 10 篇
  5. 05 评测、可观测与可追溯:怎么知道改了之后更好了 即将发布 · 8 篇
  6. 06 生产化与运营:让 AI 应用可靠、可控、可持续地跑 即将发布 · 8 篇
  7. 07 产品与体验:把不确定的能力做成可信的产品 即将发布 · 6 篇
其他系列1 个系列
  1. 面试手撕代码:从 LeetCode 中等题到 Transformer 组件 20 篇
    1. 面试手撕代码:从 LeetCode 中等题到 Transformer 组件(总纲)总览
    2. 数组、哈希与前缀和2025-12-02
    3. 双指针与滑动窗口2025-12-03
    4. 栈、单调栈与单调队列2025-12-04
    5. 链表2025-12-05
    6. 二叉树2025-12-06
    7. 图——BFS / DFS / 拓扑排序 / 并查集 / 最短路2025-12-07
    8. 二分——只有一个模板2025-12-08
    9. 堆、Top-K、区间与贪心2025-12-09
    10. 回溯2025-12-10
    11. 字符串2025-12-11
    12. 动态规划(一)——线性与二维2025-12-12
    13. 动态规划(二)——背包、区间、状态机、树形2025-12-13
    14. 设计题与数据结构实现2025-12-14
    15. 手撕 attention 家族2025-12-15
    16. 手撕 Transformer block 与反向传播2025-12-16
    17. 手撕 tokenizer 与解码2025-12-17
    18. 手撕损失函数与训练算法2025-12-18
    19. 手撕经典 ML 与评测指标2025-12-19
    20. Infra 岗手撕——并发与系统2025-12-20
    21. 系列总结与通关自测2025-12-20
×