文章

附录:术语与符号表

AI Infra 全书术语与符号表:收录 IO 栈、存储、网络、GPU、推理、调度、监控等领域的中英术语与缩写约定。

附录:术语与符号表

术语

术语(中文)英文定义/约定首次出现章节
虚拟文件系统VFS (Virtual File System)Linux 文件系统抽象层,统一所有 FS 接口,应用只与 VFS 打交道1
目录项缓存dentry (directory entry cache)缓存目录项以加速路径查找1
索引节点inode文件元数据(大小/权限/块列表),一个文件全局唯一1
页缓存page cache内核把读过的文件内容缓存在内存(4 KB/页)的统一缓冲1
脏页dirty page已写入 page cache 但尚未刷盘的页1
写回writeback后台线程把 dirty page 刷到磁盘的机制1
直接 IOO_DIRECT绕过 page cache 直接读写设备,用于测硬件真实能力1
块 IO 单元bio (block I/O)block layer 的一次 IO 请求单元1
IO 等待时间awaitiostat 中 IO 请求从入队到完成的平均等待1
放置组PG (Placement Group)对象与 OSD 之间的中间层,聚合成组后作为一个放置单位2
纠删码EC (Erasure Coding)数据切 k 块 + m 块校验,任意 m 块丢失可恢复2
副本replica数据多份复制以抗故障,空间利用率 1/副本数2
写放大write amplification实际写入量 / 有效数据量(副本3=3,EC(4,2)=6)2
可控可扩展哈希CRUSHCeph 的数据分布算法,基于集群拓扑的分层放置2
聚合带宽aggregate bandwidth集群所有节点并行读的总吞吐,厂商宣传口径;与单客户端带宽相对3
单客户端带宽single-client bandwidth单个客户端进程实际能分到的读带宽,训练 worker 的真实体验3
流式 IOstreaming I/O大块顺序读写的 IO 模式,训练数据集典型3
突发 IObursty I/O短时高并发读、稳态几乎为 0 的 IO 模式,推理冷启动典型3
远程直接内存访问RDMA网卡直接读写远端内存/显存,绕过 CPU 与内核4
无损网络lossless networkPFC/ECN 保证不丢包的网络,RDMA 的前提4
优先级流控PFC按优先级独立暂停上游发送的链路层机制4
显式拥塞通知ECN交换机在 IP 头标记拥塞,端到端软降速4
拥塞通知包CNPECN 标记后接收端回给发送端的通知包4
数据中心量化拥塞控制DCQCNECN 的端到端算法,RP/NP/CP 三角色4
集合通信collective communication多对多的数据交换操作(AllReduce/AllGather 等)5
归约AllReduce所有 rank 的数据求和后分发回每个 rank5
全收集AllGather每个 rank 拿到所有 rank 的数据5
归约-散播ReduceScatter每个 rank 拿到求和结果的 1/N 部分5
广播Broadcast根 rank 的数据发送给所有 rank5
全交换AllToAll每个 rank 给其他每个 rank 各发一份数据5
算法带宽algbwsize/time,算法视角吞吐5
总线带宽busbwalgbw × 2(N-1)/N(AllReduce),与硬件峰值可比5
环算法Ring algorithm带宽最优的 AllReduce,两阶段 N-1 步5
流式多处理器SM (Streaming Multiprocessor)GPU 的计算单元,util 指标统计的是 SM 活跃占比6
显存利用率FB_USED已用显存(MB),DCGM 指标6
双比特纠错Double Bit ECC不可纠正的显存错误,Xid 486
掉线fall off the busGPU 从 PCIe 总线消失,Xid 796
张量并行TP (Tensor Parallel)把模型权重切分到多卡并行计算6
KV 缓存KV cache注意力机制的 K/V 中间结果缓存,随 token 生成增长7
分页注意力PagedAttention把 KV cache 切成 block 按需分配,消除显存碎片7
连续批处理Continuous Batching请求完成即让位,GPU 保持满载的调度方式7
静态批处理static batching攒满一批再处理,batch 内最慢请求拖累整批7
首 token 延迟TTFT从发请求到收到第一个 token 的时间7
单 token 延迟TPOT每生成一个 token 的耗时7
成组调度Gang scheduling一整组资源同时可用才调度,避免半启动 hang8
公平分享Fair-share按历史用量比例分配资源8
抢占Preemption高优先级 job 驱逐低优先级 job 以获取资源8
放置组PodGroupVolcano 的成组调度资源,声明 minMember8
集群队列ClusterQueueKueue 的资源配额队列8
队列组cohortKueue 中共享配额池的 ClusterQueue 分组8
名义配额nominalQuotaClusterQueue 声明的基准配额8
拉取scrapePrometheus 主动从 exporter 采集指标9
计数器Counter只增不减的指标,看速率用 rate/increase9
仪表Gauge可增可减的当前值指标9
直方图Histogram分桶分布,用于算 p999
记录规则recording rule预聚合高频查询为新指标9
待触发Pending告警条件满足但 for 计时中9
触发中Firing告警条件持续满足 for 时长后正式报警9
混沌工程chaos engineering受控环境主动注入故障以验证系统韧性10
平均检测时间MTTD故障发生到被发现的时间,由监控质量决定10
平均恢复时间MTTR故障被发现到恢复的时间,由预案与 runbook 决定10
情境-任务-行动-结果STAR面试讲故事的 Situation/Task/Action/Result 结构10

| 分层假设法 | layered hypothesis method | 先看监控归层、再用该层命令验证、逐层排除的排障方法 | 11 | | 连锁故障 | cascading failure | 一个层的故障引发另一层症状(如网络拥塞→GPU 利用率下降) | 11 | | 三段式作答 | three-part answer | 结论先行 + 原理支撑 + 量化示例的面试答题结构 | 12 | | 对比框架 | comparison framework | 把方案放同一维度比较(性能/成本/复杂度)以应对”为什么不用 X” | 12 | | 版本对齐 | version alignment | 全集群驱动/CUDA/NCCL 版本一致,避免跨节点不匹配故障 | 13 | | 健康巡检 | health check | 定期自动检查驱动/链路/温度/ECC 等健康指标 | 13 | | 幂等 | idempotent | 重复执行结果相同的操作特性,脚本可安全重跑 | 13 |

符号约定

符号读法含义与约定首次出现章节
$t$t时间1
$t_1, t_2$t 一、t 二第 1/2 阶段耗时(本教材用下标区分不同阶段时间)1
GB/s吉字节每秒数据传输速率单位(本书统一用十进制 GB)1
IOPS每秒输入输出次数每秒 IO 操作数(随机读基准的常用指标)1
$k$kEC 中数据块数2
$m$mEC 中校验块数2
$R$RDCQCN 中发送端当前速率4
$\alpha$alphaDCQCN 降速比例参数(第 4 章);每步通信延迟(第 5 章)4
$N$N集合通信的 rank(GPU)总数5
$T$TRing AllReduce 总时间($T = 2(N-1)\alpha + 2(N-1)/N \cdot \text{size}/\beta$)5
$\beta$beta链路带宽5
本文由作者按照 CC BY 4.0 进行授权