焚决 · AI 教程站
书籍长青

大模型时代的基础架构:大模型算力中心建设指南

GPUNvidia DGXRoCEMagnum IO

介绍

本书系统讲解为大模型构建算力中心的基础架构,基于TOGAF方法论,涵盖GPU硬件架构(如Nvidia GH100)、GPU服务器设计(如DGX A100)、I/O框架(Magnum IO)、集群网络(RoCE)、存储、虚拟化调度、云原生平台及运营,并以自动驾驶模型训练为例展示落地设计。

章节要点

  • 1AI与大模型时代对基础架构的需求
  • 2软件程序与专用硬件的结合
  • 3GPU硬件架构剖析
  • 4GPU服务器的设计与实现
  • 5机器学习所依托的I/O框架体系
  • 6GPU集群的网络设计与实现
  • 7GPU板卡级算力调度技术
  • 8GPU虚拟化调度方案
  • 9GPU集群的网络虚拟化设计与实现
  • 10GPU集群的存储设计与实现
  • 11机器学习应用开发与运行平台的设计与实现
  • 12基于云平台的GPU集群的管理与运营
  • 13服务机器学习的GPU计算平台落地案例