本书教的是:如何让算法同事定下来的方案跑得起来、跑得快、跑得省、跑得稳。
面向两类读者:自建自运维 AI 基础设施的平台建设方(不假定算法背景,第 3 章负责补齐),以及 FAE / 解决方案架构师 / 售前 / 采购评估等方案与选型方(重点看第 4、12、31 章)。
大纲:ai-infra-book-outline.md · 写作 Prompt 包:ai-infra-book-prompts.md
维护入口:勘误与更新 · 贡献指南 · 图片来源与授权台账
分层为骨 + 两条主线为脉:分部按抽象层划分(基础认知 → 硬件 → 资源 → 数据 → 训练 → 推理 → 平台 → 治理),全书用两条主线穿透各层——
- 主线 A:一次训练任务的全生命周期
- 主线 B:一次推理请求的全链路
每章按统一七段骨架写作:链路定位 → 依赖声明 → 问题场景 → 原理与量化模型 → 方案对比(含失效边界)→ 大数据对照 → 选型决策树(第 3 章例外,用「概念直觉 → 资源事实 → 决策含义」三段式)。
| 章 |
标题 |
一句话定位 |
| 22 |
推理引擎原理 |
KV Cache、批处理调度、采样后处理;§22.6 加速特性三分法定义处 |
| 23 |
推理优化:计算类加速 |
量化、算子融合、图模式、投机推理与冲突矩阵 |
| 24 |
服务化架构与显存类加速 |
PD 分离、Prefix Cache 多级复用、前缀感知路由 |
| 25 |
弹性与多模型 |
冷启动拆解、扩缩容、LoRA 多租户部署 |
| 26 |
特殊负载 |
长上下文、Diffusion、实时语音:何时不能套用文本 LLM 经验 |
| 我想做的事 |
阅读路径 |
| 完全没有算法背景,先补基础 |
3 → 6 |
| 跑通第一次大模型训练 |
3 → 6 → 16 → 17 → 18 |
| 建一个微调平台 |
21 → §19.5 → 25 → 11 → 30 |
| 上线一个推理服务 |
22 → 23 → 24 → 29 |
| 把成本压下来 |
11 → 23 → 31 |
| 迁到国产卡 |
§5.3 → 12 → 附录 E |
| 排查性能问题 |
§5.4 → §4.4 → 11 |
| 做 RL / 后训练基础设施 |
§3.6 → §6.5 → 21 → 20 |
| 支撑多模态业务 |
§3.5 → §6.4 → 13 → 24 → 26 |
| 规划一个新集群 |
4 → 7 → 31 |
| 只想先建立全局认知 |
1 → 2 → 3 |
| 给客户做选型建议 |
4 → 12 → 31 |
| 评估一个技术方案是否成立 |
2 → 6 → 对应领域章 → 31 |
高频动作词落点:算法/模型原理 → 第 3 章(定性)+ 第 6 章(定量);训练 → 16–21;微调 → 21 + §19.5 + 25;部署 → 22–26 + 30;优化 → 23(推理)/ 17(训练)/ 11(利用率);评测 → §3.7 + 29。
- 正文只写机制,不写版本号与 API 签名;具体卡型号参数只进附录 A/C 并标注日期。
- 横切概念单点定义:精度格式 §4.3、Roofline §4.4、profiling §5.4、显存换算 §6.2、互联域 §4.1.4+第 7 章、加速特性三分法 §22.6、对标口径 §12.5、生态评估 §12.7、功率散热 §31.2——其余章节一律引用。
- 每章结尾有可验证交付物:「读完本章,你应当能……」。
- Mermaid 图统一主题与语义配色,红色只用于瓶颈与故障。
附录 A、B、C 含有高时效性数据。引用其中的具体���数、项目状态或公式前,请先查看勘误与更新中的适用口径与来源记录。提交修订时遵循贡献指南;本仓库的本地 Markdown 链接可通过 node scripts/check-doc-links.mjs 校验。
- Labs:11 个分层动手实验(L0 无 GPU 至 L3 集群),把书中公式变成可复算的观测——每个都有成功判据与清理步骤。
- 故障 Runbooks:训练侧与推理/平台侧各 6 个,九段结构、止损先于诊断;安全类仅含防御与响应。
- 参考架构:从单机 8 卡到多集群平台共 7 档,容量模型全部公式代入,每档写明失效边界与升级去向。
calculators/ 提供七个可执行估算器(训练显存 / KV 并发 / 训练工期 / 集合通信 / Checkpoint 窗口 / 推理容量 / 功率 TCO),公式与附录 B 编号双向对齐,输出含假设与不确定性;固定测试向量取自正文算例,防止与书静默漂移。用法见 calculators/examples/README.md。