智算运营是从传统IT运维到LLMOps的全栈进阶
千万级的训练任务因NCCL超时而失败,推理服务因显存溢出而崩溃,巨资购入的GPU利用率却无人说得清——AI光环下的工程问题谁来兜底?本书为AI基础设施工程师而写:从云原生到智算原生,用第一性原理串起硬件、平台、优化与运营的全栈实战。
智算运营全栈路线
核心概念
两级智算
总部承担大规模训练、边缘承担推理服务的协同架构体系。
它是央国企智算布局的主范式,决定模型分发与资源协同的效率。
MFU
模型算力利用率,衡量训练任务真正用上多少芯片理论峰值。
它是智算运营最硬的指标,直接回答投入产出是否合理。
智算原生调度
面向GPU/NPU的容器化、Device Plugin与Binpack等调度技术。
原生K8s看不见也管不好算力卡,调度策略决定集群利用率。
分布式并行
数据并行、张量并行、流水线并行等大模型训练切分策略。
千卡训练必然崩溃,运维视角理解并行才能定位故障。
LLMOps
覆盖训练、推理、监控、计费的大模型全生命周期运营体系。
它是从卖资源到卖服务、从救火到自愈的运营跃迁。
全书地图
第一篇:基石——智算硬件与网络架构
第二篇:底座——云原生AI平台构建
第三篇:核心——模型算力匹配与全栈优化
第四篇:透视——可观测性与故障自愈
第五篇:体系——两级运营与未来展望
读完这本书,你会明白
- 智算运营的硬指标是MFU与线性度
- 原生K8s不适合AI,调度必须改造
- 显存与训练时间要算出来,不靠猜
- 监控大盘从采集层到业务层全链路
- 计费按卡时还是按Token要想清楚