大模型算力底座要从芯片到云平台全栈自主设计
机器学习为何对硬件有特殊需求?把服务器买回来堆成集群,为何训练还是跑不起来?本书从一元线性回归讲起,沿芯片、服务器、网络、存储、虚拟化到云平台的顺序,回答智算中心每一层该怎么设计、为什么这样设计。
算力底座建设路线
核心概念
GPU架构
以大规模并行计算核心服务深度学习的芯片体系与服务器设计。
它是算力的物理原点,理解架构才能算清容量与瓶颈。
计算网络
基于RoCE等为GPU集群横向扩展设计的低时延高速网络。
千卡协同的通信瓶颈在网络,网络设计决定集群线性度。
分层存储
面向训练数据、checkpoint与业务数据的分级存储与网络设计。
存储吞吐跟不上,再多的卡也会在等待数据中空转。
虚拟化
GPU池化与算力切分技术,让异构算力可调度、可共享。
它把物理算力变成可运营的资源,是平台化的前提。
云原生平台
微服务、中间件与日志体系构成的机器学习应用开发运行平台。
算力只有被开发者便捷使用,基础设施的价值才能兑现。
全书地图
第三部分:应用平台与运维
第四部分:实践案例与总结
读完这本书,你会明白
- 从机器学习的本质需求出发做设计
- 网络是千卡集群的第一瓶颈
- 存储吞吐与算力规模必须匹配
- 虚拟化让算力可运营可共享
- 用真实案例检验全栈设计能力