附录:术语与符号表
AI Infra 全书术语与符号表:收录 IO 栈、存储、网络、GPU、推理、调度、监控等领域的中英术语与缩写约定。
AI Infra 全书术语与符号表:收录 IO 栈、存储、网络、GPU、推理、调度、监控等领域的中英术语与缩写约定。
教材开篇:写给有 5-8 年 Linux/存储/网络背景、准备转型 AI Infra(GPU 集群方向)的工程师,讲清全书主线与使用方法。
自动化运维与版本管理:Python/Shell 健康巡检工具建设,以及驱动 / CUDA / NCCL 版本对齐的实战方法。
面试冲刺:用"结论先行 → 原理支撑 → 量化示例"三段式回答高频 AI Infra 面试题,附对比框架应对追问。
综合实战:用"分层假设法"把 IO 栈、存储、网络、GPU、推理、调度、监控串成完整的排障闭环。
故障演练(混沌工程)与复盘:如何主动注入故障、度量 MTTD/MTTR、把一次真实故障讲成结构化的 STAR 面试故事。
用 Prometheus + PromQL 搭建 AI 集群可观测性:GPU/网络/存储指标采集、告警规则设计(含 recording rule 与 for 时长)。
三大调度器对比:Slurm(HPC 老牌)、Volcano(K8s 批处理)、Kueue(K8s 队列),讲清 Gang/Fair-share/Preemption 的工程权衡。
推理框架 vLLM 内部机制:PagedAttention 如何把 KV cache 显存利用率从 40% 提到 90%,Continuous Batching 如何提升吞吐。
GPU 硬件与监控:H100 与 A100 规格对比、DCGM 关键指标解读、Xid 错误码定位,以及"利用率上不去"的成因树。