法不净空,觉无性也。

智算运营是从传统IT运维到LLMOps的全栈进阶

千万级的训练任务因NCCL超时而失败,推理服务因显存溢出而崩溃,巨资购入的GPU利用率却无人说得清——AI光环下的工程问题谁来兜底?本书为AI基础设施工程师而写:从云原生到智算原生,用第一性原理串起硬件、平台、优化与运营的全栈实战。

智算运营全栈路线

硬件基石GPU与NPU选型…云原生底座容器化与智能…全栈优化训练推理算力…可观测性监控大盘与故…运营体系两级协同与算…

核心概念

两级智算

总部承担大规模训练、边缘承担推理服务的协同架构体系。

它是央国企智算布局的主范式,决定模型分发与资源协同的效率。

MFU

模型算力利用率,衡量训练任务真正用上多少芯片理论峰值。

它是智算运营最硬的指标,直接回答投入产出是否合理。

智算原生调度

面向GPU/NPU的容器化、Device Plugin与Binpack等调度技术。

原生K8s看不见也管不好算力卡,调度策略决定集群利用率。

分布式并行

数据并行、张量并行、流水线并行等大模型训练切分策略。

千卡训练必然崩溃,运维视角理解并行才能定位故障。

LLMOps

覆盖训练、推理、监控、计费的大模型全生命周期运营体系。

它是从卖资源到卖服务、从救火到自愈的运营跃迁。

全书地图

第二篇:底座——云原生AI平台构建

读完这本书,你会明白

  • 智算运营的硬指标是MFU与线性度
  • 原生K8s不适合AI,调度必须改造
  • 显存与训练时间要算出来,不靠猜
  • 监控大盘从采集层到业务层全链路
  • 计费按卡时还是按Token要想清楚
进入全书