法不净空,觉无性也。

大模型算力底座要从芯片到云平台全栈自主设计

机器学习为何对硬件有特殊需求?把服务器买回来堆成集群,为何训练还是跑不起来?本书从一元线性回归讲起,沿芯片、服务器、网络、存储、虚拟化到云平台的顺序,回答智算中心每一层该怎么设计、为什么这样设计。

算力底座建设路线

需求原点机器学习的硬…核心组件GPU芯片与服…集群构建网络存储与虚…平台运维云平台与应用…落地案例自动驾驶训练…

核心概念

GPU架构

以大规模并行计算核心服务深度学习的芯片体系与服务器设计。

它是算力的物理原点,理解架构才能算清容量与瓶颈。

计算网络

基于RoCE等为GPU集群横向扩展设计的低时延高速网络。

千卡协同的通信瓶颈在网络,网络设计决定集群线性度。

分层存储

面向训练数据、checkpoint与业务数据的分级存储与网络设计。

存储吞吐跟不上,再多的卡也会在等待数据中空转。

虚拟化

GPU池化与算力切分技术,让异构算力可调度、可共享。

它把物理算力变成可运营的资源,是平台化的前提。

云原生平台

微服务、中间件与日志体系构成的机器学习应用开发运行平台。

算力只有被开发者便捷使用,基础设施的价值才能兑现。

全书地图

读完这本书,你会明白

  • 从机器学习的本质需求出发做设计
  • 网络是千卡集群的第一瓶颈
  • 存储吞吐与算力规模必须匹配
  • 虚拟化让算力可运营可共享
  • 用真实案例检验全栈设计能力
进入全书