AI Infra 教材

AI Infra 教材

写给有 5–8 年 Linux / 存储 / 网络运维经验、想转 AI Infra(GPU 集群方向)的工程师。 主线:数据怎么走 → 算力怎么用 → 故障怎么办。

章节目录

#章节主题
0序章教材怎么用 + 全书主线
1第 1 章 Linux 内核 IO 栈与 VFS数据从磁盘到进程
2第 2 章 分布式存储:Ceph 核心CRUSH / PG / BlueStore
3第 3 章 存储选型JuiceFS / 3FS / Lustre 怎么选
4第 4 章 RDMA 与无损网络IB / RoCE / PFC / ECN / DCQCN
5第 5 章 NCCL 与集合通信AllReduce 数学与 hang 排查
6第 6 章 GPU 硬件与 CUDA/DCGM利用率上不去时怎么查
7第 7 章 推理框架:vLLM 与 PagedAttentionKV cache 与连续批处理
8第 8 章 调度与多租户Slurm / Volcano / Kueue
9第 9 章 可观测性与告警Prometheus / PromQL / 告警
10第 10 章 故障演练与 STAR 叙事混沌工程 / 复盘 / 面试故事
11第 11 章 综合实战:集群故障排查把前面 10 章串起来
12第 12 章 面试冲刺高频题 + 答题框架
13第 13 章 自动化运维与版本管理健康巡检 + 驱动/CUDA/NCCL 对齐
术语与符号表全书术语、符号、缩写约定

怎么用

每章开头先看”本章学习目标”,学完用章末自检清单逐条确认。例题要照着算一遍,独立习题做完再翻。/categories/ai-infra/ 里按分类聚合了所有章节。