LLM 推理 Infra 学习路径¶
一条系统、完整、对新手友好的 LLM 推理基础设施学习路径——围绕唯一的北极星:最大化 vLLM 并发与后端服务器吞吐。面向有扎实 PyTorch 基础、冲刺大厂推理 Infra 岗的人。
本站双语。英文为默认语种,简体中文译文位于 /zh/。中文浏览器首次访问会自动跳转到中文;你也可以随时用页首的语言切换器切换。
你会得到什么¶
- Part 0–8,按「动机先行」排序——每个优化都是你能推导出的结论,而非需要死记的事实。
- 一个精选高频面试题库,按模块归类,每题:直接答案 → 深入原理 → 代码 → 面试官追问 → 关联知识点。
- 一个吞吐拉满 Capstone:在单张 RTX 4090、¥500 AutoDL 预算内把
Qwen2.5-7B-Instruct的吞吐拉到极限,并产出「优化前 → 后」报告。
每节课怎么组织¶
每节课都遵循同一个 9 段骨架:
- 直觉 & 为什么重要
- 心智模型 / 图
- 原理与数学(KaTeX)
- 完整可跑代码 + 逐行讲解
- Lab(含 GPU 标注)
- 常见坑 / 反直觉点
- 面试连线(链到题库)
- 一句话小结 + 延伸阅读
- 自测小问(答案折叠)
样板课 KV 缓存 完整演示了这套骨架。
基线(让数字保持一致)¶
| 维度 | 基线 | 出处 |
|---|---|---|
| GPU / 模型 | 单张 RTX 4090(24 GB)+ Qwen2.5-7B-Instruct(量化) |
ADR-0001 |
| 深度 | 读懂 + 会调 + 应用层;会写少量 Triton;能读 vLLM CUDA/Triton 源码(不手写 CUDA C++) | ADR-0002 |
| vLLM | 基线 v0.26.0,每页页顶标注 | ADR-0004 |
关于本站的数字
文中一切性能数字均为示例 / 量级参考。遵循 ADR-0004,课程经 Context7 静态核实、不执行代码——真实数字由你在自己的 AutoDL 环境复现。
哪些东西被钉住、为什么数字是示例、以及 vLLM 升级时如何刷新内容,见 版本 & 如何刷新。
GPU 标注约定¶
任何需要 GPU 的页面或代码块,都会带一个这样的 callout:
GPU Lab
- 最低显存: 如 24 GB
- 建议 AutoDL 卡型: 如 RTX 4090(24 GB)
- 预估耗时 / 花费: 如 ~15 分钟 · ~¥1(示例)
- 平台: NVIDIA CUDA(默认)
- 非 NVIDIA: 相关处标注 AMD ROCm / Intel / TPU / AWS Neuron / CPU 的差异
从这里开始¶
- 刚接触推理 Infra?从 Part 0 · 基础与动机 开始。
- 想先过一遍术语?看 术语表。