跳转至

LLM 推理 Infra 学习路径

一条系统、完整、对新手友好LLM 推理基础设施学习路径——围绕唯一的北极星:最大化 vLLM 并发与后端服务器吞吐。面向有扎实 PyTorch 基础、冲刺大厂推理 Infra 岗的人。

本站双语。英文为默认语种,简体中文译文位于 /zh/。中文浏览器首次访问会自动跳转到中文;你也可以随时用页首的语言切换器切换。

你会得到什么

  • Part 0–8,按「动机先行」排序——每个优化都是你能推导出的结论,而非需要死记的事实。
  • 一个精选高频面试题库,按模块归类,每题:直接答案 → 深入原理 → 代码 → 面试官追问 → 关联知识点。
  • 一个吞吐拉满 Capstone:在单张 RTX 4090、¥500 AutoDL 预算内把 Qwen2.5-7B-Instruct 的吞吐拉到极限,并产出「优化前 → 后」报告。

每节课怎么组织

每节课都遵循同一个 9 段骨架

  1. 直觉 & 为什么重要
  2. 心智模型 / 图
  3. 原理与数学(KaTeX)
  4. 完整可跑代码 + 逐行讲解
  5. Lab(含 GPU 标注
  6. 常见坑 / 反直觉点
  7. 面试连线(链到题库)
  8. 一句话小结 + 延伸阅读
  9. 自测小问(答案折叠)

样板课 KV 缓存 完整演示了这套骨架。

基线(让数字保持一致)

维度 基线 出处
GPU / 模型 单张 RTX 4090(24 GB)+ Qwen2.5-7B-Instruct(量化) ADR-0001
深度 读懂 + 会调 + 应用层;会写少量 Triton;能读 vLLM CUDA/Triton 源码(不手写 CUDA C++) ADR-0002
vLLM 基线 v0.26.0,每页页顶标注 ADR-0004

关于本站的数字

文中一切性能数字均为示例 / 量级参考。遵循 ADR-0004,课程经 Context7 静态核实、不执行代码——真实数字由你在自己的 AutoDL 环境复现。

哪些东西被钉住、为什么数字是示例、以及 vLLM 升级时如何刷新内容,见 版本 & 如何刷新

GPU 标注约定

任何需要 GPU 的页面或代码块,都会带一个这样的 callout:

GPU Lab

  • 最低显存: 如 24 GB
  • 建议 AutoDL 卡型: 如 RTX 4090(24 GB)
  • 预估耗时 / 花费: 如 ~15 分钟 · ~¥1(示例)
  • 平台: NVIDIA CUDA(默认)
  • 非 NVIDIA: 相关处标注 AMD ROCm / Intel / TPU / AWS Neuron / CPU 的差异

从这里开始