书书籍长青
大模型时代的基础架构:大模型算力中心建设指南
GPUNvidia DGXRoCEMagnum IO
介绍
本书系统讲解为大模型构建算力中心的基础架构,基于TOGAF方法论,涵盖GPU硬件架构(如Nvidia GH100)、GPU服务器设计(如DGX A100)、I/O框架(Magnum IO)、集群网络(RoCE)、存储、虚拟化调度、云原生平台及运营,并以自动驾驶模型训练为例展示落地设计。
章节要点
- 第 1 章AI与大模型时代对基础架构的需求
- 第 2 章软件程序与专用硬件的结合
- 第 3 章GPU硬件架构剖析
- 第 4 章GPU服务器的设计与实现
- 第 5 章机器学习所依托的I/O框架体系
- 第 6 章GPU集群的网络设计与实现
- 第 7 章GPU板卡级算力调度技术
- 第 8 章GPU虚拟化调度方案
- 第 9 章GPU集群的网络虚拟化设计与实现
- 第 10 章GPU集群的存储设计与实现
- 第 11 章机器学习应用开发与运行平台的设计与实现
- 第 12 章基于云平台的GPU集群的管理与运营
- 第 13 章服务机器学习的GPU计算平台落地案例