Skip to content

Latest commit

 

History

51 Commits

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 

《AI Infra》

本书教的是:如何让算法同事定下来的方案跑得起来、跑得快、跑得省、跑得稳。

面向两类读者:自建自运维 AI 基础设施的平台建设方(不假定算法背景,第 3 章负责补齐),以及 FAE / 解决方案架构师 / 售前 / 采购评估等方案与选型方(重点看第 4、12、31 章)。

大纲:ai-infra-book-outline.md · 写作 Prompt 包:ai-infra-book-prompts.md

维护入口:勘误与更新 · 贡献指南 · 图片来源与授权台账

全书组织

分层为骨 + 两条主线为脉:分部按抽象层划分(基础认知 → 硬件 → 资源 → 数据 → 训练 → 推理 → 平台 → 治理),全书用两条主线穿透各层——

  • 主线 A:一次训练任务的全生命周期
  • 主线 B:一次推理请求的全链路

每章按统一七段骨架写作:链路定位 → 依赖声明 → 问题场景 → 原理与量化模型 → 方案对比(含失效边界)→ 大数据对照 → 选型决策树(第 3 章例外,用「概念直觉 → 资源事实 → 决策含义」三段式)。


目录

第一部分 基础与心智模型

标题 一��话定位
1 从大数据基础设施到 AI 基础设施 老经验的复用边界与失效边界
2 两条主线解剖与框架地图 全书坐标系:两条链路 + 框架三层地图
3 人工智能与大模型基础 算法概念 → 资源事实的转译层
4 硬件第一性原理、架构范式与数值精度 四个数字、超节点、精度格式(§4.3 全书唯一定义处)、Roofline
5 CUDA、CANN 与加速器软件栈 双栈对照;§5.4 profiling 方法论定义处
6 模型结构的定量分析 算多少:§6.2 显存三分与参数换算定义处,五六部分的入场券
7 互联与集合通信 互联域与三级拓扑——全书后半部反复引用的域边界

第二部分 算力底座

标题 一句话定位
8 K8s 上的加速卡 设备插件、拓扑感知调度、节点生命周期
9 批调度器 Gang Scheduling、队列配额抢占、混部
10 异构与池化 该不该切分/池化算力
11 多租户与利用率治理 MFU 与真实利用率(MFU 口径定义处)、归因体系
12 国产算力平台与异构迁移 迁移三道坎;§12.5 对标口径、§12.7 生态评估定义处

第三部分 数据底座

标题 一句话定位
13 训练数据管道 大数据经验密度最高的一章;数据飞轮
14 存储与 Checkpoint I/O 三层存储分工、突发写模式与写入窗口估算
15 向量与检索基础设施 索引结构的资源画像与规模成本

第四部分 训练系统

标题 一句话定位
16 并行策略 DP/TP/PP/EP/SP 可计算选型;超节点改写并行经验
17 显存与训练侧精度机制 ZeRO、重计算、Offload、FP8 训练与数值发散排查
18 并行运行时剖析 Megatron-Core / DeepSpeed / FSDP2 按机制五维对照
19 训练工程层与编排 §19.3 三层接口契约;§19.5 微调即服务
20 稳定性与容错 失败率模型、故障域放大、断点续训
21 后训练基础设施 RL 的 rollout/train 资源潮汐与混合架构

第五部分 推理系统

标题 一句话定位
22 推理引擎原理 KV Cache、批处理调度、采样后处理;§22.6 加速特性三分法定义处
23 推理优化:计算类加速 量化、算子融合、图模式、投机推理与冲突矩阵
24 服务化架构与显存类加速 PD 分离、Prefix Cache 多级复用、前缀感知路由
25 弹性与多模型 冷启动拆解、扩缩容、LoRA 多租户部署
26 特殊负载 长上下文、Diffusion、实时语音:何时不能套用文本 LLM 经验

第六部分 上层平台

标题 一句话定位
27 模型网关 token 级限流计费、多供应商路由与故障转移
28 Agent 运行时基础设施 沙箱、工具调用、会话状态的资源与隔离方案
29 可观测性与评测流水线 LLM 指标体系;评测作为吃卡的批任务接进 CI

第七部分 工程化与治理

标题 一句话定位
30 模型生命周期管理 注册、血缘、灰度回滚、与数据飞轮的闭环
31 容量、成本与 SLO 全书收口:QPS→卡数→功率推导链;§31.2 功率散热定义处;TCO

附录

附录 标题 说明
A 加速卡与集群形态速查表 参数对照、负载倾向标注、超节点形态(标注数据日期)
B 估算公式速查与符号表 第 6/7/16/17 章公式汇总、精度对照表、全书符号
C 框架选型快照 三层框架地图项目清单与选型矩阵(标注数据日期)
D 术语表 CUDA↔CANN 双向对照、算法术语资源含义速查
E 异构迁移评估清单 第 12 章配套可打印打分表
F 算法深入读物推荐 本书有意不覆盖内容的延伸出口

阅读路径:我想做的事 → 读哪几章

我想做的事 阅读路径
完全没有算法背景,先补基础 3 → 6
跑通第一次大模型训练 3 → 6 → 16 → 17 → 18
建一个微调平台 21 → §19.5 → 25 → 11 → 30
上线一个推理服务 22 → 23 → 24 → 29
把成本压下来 11 → 23 → 31
迁到国产卡 §5.3 → 12 → 附录 E
排查性能问题 §5.4§4.4 → 11
做 RL / 后训练基础设施 §3.6§6.5 → 21 → 20
支撑多模态业务 §3.5§6.4 → 13 → 24 → 26
规划一个新集群 4 → 7 → 31
只想先建立全局认知 1 → 2 → 3
给客户做选型建议 4 → 12 → 31
评估一个技术方案是否成立 2 → 6 → 对应领域章 → 31

高频动作词落点:算法/模型原理 → 第 3 章(定性)+ 第 6 章(定量);训练 → 16–21;微调 → 21 + §19.5 + 25;部署 → 22–26 + 30;优化 → 23(推理)/ 17(训练)/ 11(利用率);评测 → §3.7 + 29。

写作纪律速记

  • 正文只写机制,不写版本号与 API 签名;具体卡型号参数只进附录 A/C 并标注日期。
  • 横切概念单点定义:精度格式 §4.3、Roofline §4.4、profiling §5.4、显存换算 §6.2、互联域 §4.1.4+第 7 章、加速特性三分法 §22.6、对标口径 §12.5、生态评估 §12.7、功率散热 §31.2——其余章节一律引用。
  • 每章结尾有可验证交付物:「读完本章,你应当能……」。
  • Mermaid 图统一主题与语义配色,红色只用于瓶颈与故障

维护与数据更新

附录 A、B、C 含有高时效性数据。引用其中的具体���数、项目状态或公式前,请先查看勘误与更新中的适用口径与来源记录。提交修订时遵循贡献指南;本仓库的本地 Markdown 链接可通过 node scripts/check-doc-links.mjs 校验。

Labs、Runbooks 与参考架构

  • Labs:11 个分层动手实验(L0 无 GPU 至 L3 集群),把书中公式变成可复算的观测——每个都有成功判据与清理步骤。
  • 故障 Runbooks:训练侧与推理/平台侧各 6 个,九段结构、止损先于诊断;安全类仅含防御与响应。
  • 参考架构:从单机 8 卡到多集群平台共 7 档,容量模型全部公式代入,每档写明失效边界与升级去向。

配套估算器

calculators/ 提供七个可执行估算器(训练显存 / KV 并发 / 训练工期 / 集合通信 / Checkpoint 窗口 / 推理容量 / 功率 TCO),公式与附录 B 编号双向对齐,输出含假设与不确定性;固定测试向量取自正文算例,防止与书静默漂移。用法见 calculators/examples/README.md

许可证与引用

  • 书稿内容(章节、附录、自绘图、数据):CC BY 4.0,转载须署名;第三方图片按 images/sources.yaml 登记的原始许可使用(含一张 CC BY-SA 4.0)。
  • 代码与脚本(scripts/ 等):MIT
  • 学术引用元数据见 CITATION.cff;版本语义见 book-version.yamlCHANGELOG.md

About

《AI Infra》:面向平台建设方的中文 AI 基础设施书稿——31 章 + 附录 + 结构化数据与证据体系

Topics

Resources

Code of conduct

Contributing

Security policy

Stars

8 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages