关于
关于我
lkad,做了十几年运维,现在在往 AI Infra 转。
最早干网络,交换机路由器那一套。后来转做 SRE/DevOps,K8s、Ceph、Prometheus 一路用下来。23 年 ChatGPT 出来的时候开始跟着学机器学习,自己手搓过一个数字识别模型,后来把各种大模型的原理也都过了一遍。现在集中火力往底层钻,操作系统、GPU/TPU 的调度和控制这些。跟专门做 AI 的人比肯定差得远,不过真到了集群出故障的时候,我这些年的底子还能用上。
这个博客
主要拿来记东西。踩过的坑不当场写下来,过俩月准忘。
写得最多的是那套 AI Infra 教材,从 IO 栈一直讲到调度和故障排查,13 章,还在改。写的时候尽量给能跑的命令、能对上的数字,被网上互相抄的博客坑太多次了。
写在最后
做了这么多年运维,脑子里就三件事:稳定、安全、降本。听着土,但系统挂一次、预算超一次,就知道这几条多实在。
35 之后转行这事,周围人劝过,自己也犹豫过挺久。后来想想还能咋办呢,接着干吧。