跳转至

Part 2 · 单卡推理性能

你已从 Part 0 拿到硬件心智模型;这个 Part 让它可量化——仅凭形状推导任何算子的状态、算好部署的显存预算,并用两个 kernel 级收益(FlashAttention、CUDA graphs)把单张 GPU 榨到极致。

本 Part 覆盖

  • 算子 roofline:为 GEMM 与 attention 推导算术强度——为什么 decode 在 \(I\approx1\) memory-bound、prefill compute-bound,以及越过拐点的 batch 大小
  • KV 缓存显存数学:完整显存预算(权重 + KV + 激活 + 开销)与如何解出最大并发
  • FlashAttention:IO-aware 思想(tiling + online softmax)——同 FLOPs、\(O(S^2)\to O(S)\) 内存,以及长上下文 prefill 为何可行
  • Kernel fusion 与 CUDA graphs:为什么 decode 阶段的 launch overhead 致命,以及 fusion 与图重放如何收回它

本 Part 建立于的硬件入门——内存层级与 roofline延迟/吞吐度量——在 Part 0。性能术语见 术语表

课程

Part 2 完成

四节课全部写就,各带一道双向链接的面试题。所有 vLLM flag/API 经 Context7 核实(ADR-0004);基线为 vLLM 0.26.0。链接题集见 面试题库