文章

序章:AI Infra 工程师实战(GPU 集群方向)

教材开篇:写给有 5-8 年 Linux/存储/网络背景、准备转型 AI Infra(GPU 集群方向)的工程师,讲清全书主线与使用方法。

序章:AI Infra 工程师实战(GPU 集群方向)

本书写给谁

这本书写给有 Linux 运维 / 存储 / 网络背景、正准备转型 AI Infra(GPU 集群方向)的工程师。你大概有 5-8 年的 SRE / HPC / 大规模存储经验,熟悉 Ceph、Slurm、K8s,但还没深入 GPU 集群和 AI 训练推理。

读完这本书,你应该能:从 IO 栈、存储、网络、GPU、推理、调度、监控到故障,完整地讲清一个 AI 集群的每个环节,并用数据(而非直觉)定位瓶颈、做选型、讲好一个故障故事。

怎么用这本书

  • 每章开头有”本章学习目标”:读完先对照它,学完用章末的自检清单逐条确认学会了没有;
  • 示范例题要跟着算一遍:每道例题都给了完整推导和验证代码,自己动手复算一遍最有效;
  • 引导练习先自己想:每道引导练习有”提示 1 → 提示 2 → 完整解答”三层,先看到提示 1 自己试,卡住再看下一层;
  • 独立习题做完再翻答案:独立习题的题干在章内,参考答案和验证过程统一在 98-参考答案.md,先自己做再对照;
  • 不认识的词与记号查术语表术语表.md 有术语和符号两个对照表,全书的约定都在里面;
  • 最后一章是综合检验99-表现性任务.md 给了 3 个迁移性任务(新集群排查 / 存储选型 / 面试叙事),做完能检验你能否把知识用到新场景。

全书主线

这本书有一条主线:数据怎么走 → 算力怎么用 → 故障怎么办。前 5 章建立”数据通路”(存储、网络、集合通信),第 6-8 章讲”算力使用”(GPU、推理、调度),第 9-10 章收束到”可靠运行”(监控、故障、复盘)。

图 0-1:全书主线

flowchart LR
    subgraph "数据怎么走"
        A1[Ch1 IO栈] --> A2[Ch2-3 存储]
        A2 --> A3[Ch4 RDMA]
        A3 --> A4[Ch5 NCCL]
    end
    subgraph "算力怎么用"
        B1[Ch6 GPU] --> B2[Ch7 推理]
        B2 --> B3[Ch8 调度]
    end
    subgraph "故障怎么办"
        C1[Ch9 监控] --> C2[Ch10 故障/复盘]
    end
    A4 --> B1
    B3 --> C1

主线背后的三个贯穿问题(核心问题 Q1-Q3,会在多章反复回来):

  • Q1:集群变慢时,瓶颈在计算、网络、存储还是调度?怎么用数据定位?
  • Q2:训练与推理的存储需求为什么不同?一套系统能否兼顾?
  • Q3:集群的”稳定”来自硬件、软件还是流程?三者的贡献如何衡量?

目录

附:术语与符号表

本文由作者按照 CC BY 4.0 进行授权