课程目录

第 14 周 · 专题

第14周:AI硬件产业链专题

从芯片、封装、HBM到数据中心与边缘终端

周目标:建立AI硬件7层产业链视角,能判断算力供给、成本、瓶颈与国产替代路径

课程成果:CO7 CO8

已学习 0 / 7 天

本周 7 个学习日

Day 92

AI硬件7层总览

建议时长:75 分钟

本日 CO:CO1 CO7 CO8

本日概要

把 AI 硬件按层拆开,是为了让「算力从哪来、卡在哪里」这个问题有结构化的答案。自下而上大致是:材料与设备、晶圆制造、芯片设计、先进封装与存储、板卡与整机、网络与数据中心、以及上层的软件栈与生态。每一层都有自己的产能约束与技术门槛,而整条链的产出受最紧的那一环限制。分析时要避免两个常见错误:一是只盯芯片设计而忽略封装与存储的产能,二是把软件生态当作附属品——迁移成本往往才是实际选型中最重的一项。

听书与视频

本日听书

6 分钟 · MP3 · 双主持人讲解

B 站讲解

AI硬件的七大类,你了解多少?

vi姐硬说Ai · 已核验 2026-08-29

在 B 站打开

学习目标

  • 能按层描述 AI 硬件产业链,并说明各层之间的依赖关系
  • 能识别整条链上的瓶颈环节,并解释为什么产出受最紧一环限制
  • 能区分技术门槛、产能约束与生态门槛三类不同性质的壁垒
  • 能为每条产业事实标注可回查的来源与访问日期,区分事实与推断

核心讲解

分层与依赖

最底层是材料与制造设备,它决定了先进制程能否量产;往上是晶圆制造,把设计变成实际的芯片;再往上是芯片设计,包括处理器、加速器与配套的接口逻辑。封装与存储层近年成为关键:高带宽存储通过垂直堆叠与靠近计算die布置,把访存带宽提上来,而这依赖先进封装工艺。再往上是板卡与整机,涉及供电、散热与互连;然后是机柜、网络与数据中心;最上层是编译器、运行时、框架与算子库构成的软件栈。

各层之间是串行依赖:任一层的产能或良率不足,都会成为整条链的上限。这解释了一个常见现象——芯片设计能力并不稀缺,但先进封装与高带宽存储的产能在某些时期成为实际瓶颈。因此分析产业链时不能只看某一层的技术新闻,而要问「这一层的产出能否匹配相邻层的需求」,并尽量找到可回查的公开数据支撑判断。

三类壁垒不能混为一谈

技术门槛指的是能否做出来,例如先进制程的工艺能力;产能约束指的是能做多少,例如封装产线的月产能;生态门槛指的是做出来之后能否被用起来,例如算子覆盖度、框架适配与已有代码的迁移成本。三者性质不同,缓解路径也不同:技术门槛靠研发突破,产能约束靠投资与时间,生态门槛靠长期的工具链建设与社区积累。

实际选型中,生态门槛常常是最被低估的一项。一块峰值算力很高的加速卡,如果关键算子缺失、框架版本适配滞后、或调试工具不成熟,团队实际能拿到的有效算力会远低于标称值,迁移过程中的人力投入也很难提前估准。因此产业链分析的结论里,应当把「迁移成本」作为一个显式条目,而不是笼统地说「生态还需完善」。

实践任务

画一张 AI 硬件分层图,逐层标注关键环节、代表性技术门槛与当前公开可查的瓶颈,并注明每条信息的来源与访问日期。

  • 画出七层分层图,为每层写出两到三个关键环节与它承担的职责。
  • 为每层标注一项可公开查证的技术门槛或产能信息,附来源链接与本人访问日期;查不到的一律标为「未找到公开数据」。
  • 指出当前你认为最紧的一到两个环节,写明判断依据是公开数据、行业报道还是个人推断。
  • 为其中一层分别列出技术门槛、产能约束与生态门槛三类壁垒各一条,说明它们的缓解路径有何不同。

自测与答案

第 1 题

为什么分析 AI 硬件产业链时不能只关注芯片设计这一层?

尚未检查本题。

查看答案与评价要点

参考答案:整条链是串行依赖,产出受最紧的一环限制。芯片设计能力充足时,先进封装产能、高带宽存储供给或软件生态成熟度都可能成为实际瓶颈。只看单层的技术进展会得出与实际供给不符的判断,必须逐层核对相邻层的供需匹配情况。

评价要点:指出串行依赖与最紧环节决定产出;举出封装、存储或生态等其他层的约束;强调需逐层核对供需匹配

第 2 题

技术门槛、产能约束与生态门槛有什么区别?为什么必须分开讨论?

尚未检查本题。

查看答案与评价要点

参考答案:技术门槛是能否做出来,产能约束是能做多少,生态门槛是做出来后能否被有效使用。三者的缓解路径不同:分别对应研发突破、投资与时间、以及长期工具链与社区建设。混为一谈会导致误判解决周期——把生态问题当技术问题,会低估所需的时间与人力投入。

评价要点:准确区分三类壁垒的含义;指出各自的缓解路径不同;说明混淆会导致误判解决周期

尚未完成自测。

今日完成标准

  • 提交七层分层图,每层含关键环节与职责说明
  • 每层至少一项信息附可回查来源与访问日期,未找到数据的条目被如实标注
  • 提交三类壁垒的对比说明与瓶颈判断,明确区分公开数据与个人推断

常见错误与纠正提示

  • 只依据单层技术新闻判断整条链的供给状况
  • 把生态成熟度问题当作技术问题,低估迁移所需的时间与人力
  • 引用未标注来源的数字,或把行业传闻表述为确定事实

分层任务

基础任务

在教师提供的分层图骨架上补齐三层的关键环节,并为其中一层找到一条可回查来源。

标准任务

独立完成七层图、来源标注与三类壁垒对比。

挑战任务

选一层做纵向追踪:整理近两年该层的公开产能或技术进展信息,说明它如何改变整条链的瓶颈位置。

关联知识点

延伸阅读

学习状态:未学习

Day 93

GPU/GPGPU/NPU路线

建议时长:75 分钟

本日 CO:CO1 CO7 CO8

本日概要

加速器的路线差异不只在硬件,更在软件栈。同一类矩阵运算,不同厂商用不同的编程模型、编译器与算子库来实现,因此「峰值算力」这个数字无法直接横向比较——真正决定有效算力的是算子覆盖度、编译优化质量与框架适配程度。评估一条技术路线时,应当把问题拆成四项:目标模型的关键算子是否被支持、常用框架的版本适配是否及时、调试与性能分析工具是否可用、以及已有代码的迁移改动量有多大。这四项都需要用自己的模型实测,而不是依据宣传材料判断。

听书与视频

本日听书

6 分钟 · MP3 · 双主持人讲解

B 站讲解

【硬核解析】从GPGPU到CUDA,看完秒懂GPU为何主宰AI !(GPU渲染管线工作原理大揭秘)!!

云计算科普研究所 · 已核验 2026-08-29

在 B 站打开

学习目标

  • 能说明峰值算力为何不能作为跨厂商的横向比较依据
  • 能拆解加速器软件栈的层次,并说明各层对有效算力的影响
  • 能设计一份加速器路线评估表,覆盖算子、框架、工具与迁移四项
  • 能用自己的模型做实测,并把结论与测试条件绑定

核心讲解

从峰值到有效算力

峰值算力是在理想条件下的理论上限:特定精度、特定算子、数据全部就位、无通信开销。真实训练或推理中,数据搬运、算子实现质量、内存带宽与多卡通信都会让实际利用率远低于峰值,且不同硬件的差距模式并不相同。因此把两个厂商的峰值数字相除得出「性能比」,是没有依据的推理。可比较的做法是固定模型、固定精度、固定批大小与数据管道,测端到端的吞吐或延迟,并完整记录测试条件。

软件栈决定了峰值中有多少能被拿到。以主流的通用并行计算平台为例,其编程模型、编译器与算子库经过长期积累,覆盖度与优化质量较高;国产路线以异构计算架构为核心,同样提供了从编程接口到算子库的完整层次。评估时要看的不是「有没有对应的层」,而是「目标模型用到的具体算子是否被高效实现」——缺一个关键算子就可能让整个模型退回到低效路径。

四项评估落到实测

第一项是算子覆盖:列出目标模型用到的算子,逐个确认是否被原生支持,未支持的是否有等价替代及其性能代价。第二项是框架适配:确认所用框架版本是否被官方支持、适配滞后多久、以及升级框架时的兼容性。第三项是工具:性能分析器、调试器、内存诊断是否可用——工具缺失会让性能问题的定位成本急剧上升。第四项是迁移改动量:把一份已有代码实际迁移一遍,统计改动的文件数与行数,比任何估计都准确。

这四项都应当用自己的模型和代码实测,并把结论与测试条件一起记录。厂商提供的基准通常在最有利的配置下取得,与自身场景的差距可能很大。写评估报告时,应当明确区分三类信息:本人实测得到的、官方文档中查证的、以及来自第三方报道尚未核实的——第三类必须标注为待验证。

实践任务

为一个具体模型评估两条加速器路线的适配情况,逐项记录算子覆盖、框架版本、工具可用性与迁移改动量。

  • 选定一个具体模型,导出其算子清单,为两条候选路线逐个确认支持情况并记录未支持算子的替代方案。
  • 确认两条路线对所用框架版本的支持情况与适配时间差,记录官方文档中的对应说明位置。
  • 列出两条路线可用的性能分析与调试工具,实际运行一次性能分析并记录能得到哪些信息。
  • 把一份已有代码在两条路线上各迁移一遍,统计改动文件数与行数、遇到的主要问题及解决耗时;汇总为评估表并标注每条信息的来源类型。

自测与答案

第 1 题

为什么把两款加速卡的峰值算力相除得到的「性能比」没有依据?

尚未检查本题。

查看答案与评价要点

参考答案:峰值是理想条件下的理论上限,未计入数据搬运、算子实现质量、内存带宽与多卡通信的影响,而这些因素在不同硬件上的影响模式不同,实际利用率差异很大。可比较的做法是固定模型、精度、批大小与数据管道,测端到端吞吐或延迟并记录完整测试条件。

评价要点:指出峰值是理想条件下的上限;列出数据搬运、算子质量或通信等实际因素;给出固定条件下端到端实测的替代方法

第 2 题

评估一条加速器技术路线时,为什么「迁移改动量」必须实测而不能估计?

尚未检查本题。

查看答案与评价要点

参考答案:迁移成本取决于目标模型用到的具体算子、框架版本适配情况与代码中对特定接口的依赖程度,这些因素组合起来的影响很难提前估准;缺一个关键算子就可能导致大范围重写。实际迁移一份代码并统计改动文件数、行数与遇到的问题,比任何估计都可靠,也能暴露文档中没写的细节。

评价要点:指出影响因素组合复杂难以预估;举出关键算子缺失导致大范围改动;提出实际迁移并统计改动量

尚未完成自测。

今日完成标准

  • 提交两条路线的算子覆盖清单与未支持算子的替代方案及性能代价
  • 提交框架适配情况、可用工具与一次实际性能分析的结果
  • 提交迁移改动量统计与完整评估表,每条信息标注为实测、官方文档或待验证

常见错误与纠正提示

  • 用峰值算力直接横向比较不同厂商的产品
  • 只确认软件栈「有对应的层」,不核对目标模型的具体算子是否被高效支持
  • 引用厂商基准数据而不核对其测试配置与自身场景的差距

分层任务

基础任务

在教师提供的算子清单上完成一条路线的覆盖确认,并说明未支持算子的影响。

标准任务

独立完成两条路线的四项评估与实际迁移统计。

挑战任务

对同一模型在两条路线上做固定条件的端到端实测,报告吞吐与利用率,并解释差距主要来自哪一层。

关联知识点

延伸阅读

学习状态:未学习

Day 94

先进封装与HBM

建议时长:75 分钟

本日 CO:CO1 CO7 CO8

本日概要

大模型推理受限于访存而非纯算力,这使存储与封装成为决定性能的关键。高带宽存储通过把多层存储裸片垂直堆叠并与计算裸片紧密耦合,用极宽的接口换取带宽——JEDEC 的相关标准把接口划分为多个独立通道并规定了时序与封装约束。这条路线依赖先进封装工艺,因而把存储供给与封装产能绑在了一起。评估一块加速卡是否适合某个模型时,除了算力还必须看两件事:显存容量能否放下模型权重与键值缓存,以及带宽能否支撑目标的生成速度。

听书与视频

本日听书

6 分钟 · MP3 · 双主持人讲解

B 站讲解

【存储深度】HBM深度解读:AI最贵的血液,国产替代到哪一步了

李灵犀2025 · 已核验 2026-08-29

在 B 站打开

学习目标

  • 能说明高带宽存储通过什么结构获得带宽优势,以及它对封装工艺的依赖
  • 能估算模型权重与键值缓存的显存占用,并判断硬件容量是否足够
  • 能把目标生成速度换算为所需的访存带宽,并与硬件规格对照
  • 能识别估算中的不确定项并明确标注,而不是给出单一确定数字

核心讲解

带宽来自结构而非频率

传统存储通过提高频率来增加带宽,代价是功耗与信号完整性压力迅速上升。高带宽存储换了一条路:把多层存储裸片垂直堆叠,通过硅通孔连接,并与计算裸片在同一封装内紧密耦合,从而可以使用非常宽的接口——JEDEC 的规范把接口划分为多个独立通道,每个通道可独立操作。宽而相对低频的设计在同等功耗下提供了更高的总带宽,这正是它成为加速器标配的原因。

代价是它必须依赖先进封装:垂直堆叠、硅通孔与中介层工艺都属于高难度制程,产能扩张周期长。这就把两件事绑在了一起——存储供给的紧张往往同时是封装产能的紧张。分析供给状况时把两者分开看,容易得出片面结论;把它们作为同一个约束来分析,更接近实际。

容量与带宽的双重检查

评估硬件能否跑一个模型,第一步是容量:模型权重按参数量与数值位宽估算,再加上推理时的键值缓存——后者与层数、序列长度、批大小和并发数相关,长上下文高并发场景下它可能超过权重本身。把两部分相加再留出运行时开销,才是实际需要的显存。容量不足时,要么降低并发与上下文,要么量化,要么改用多卡切分,而多卡又会引入通信开销。

第二步是带宽。解码阶段每生成一个词元都需要把模型权重读一遍,因此每秒能生成多少词元大致受「带宽除以每次读取的数据量」限制。用目标生成速度反推所需带宽,再与硬件规格对照,就能在采购前判断可行性。需要强调的是,这类估算给出的是数量级判断而非精确值——实际还受算子实现、批处理效率与缓存命中影响,因此结论应当写成范围并列出不确定项,最终以实测为准。

实践任务

为一个具体模型估算所需的显存容量与带宽,对照候选硬件的公开规格判断可行性,并说明估算中的不确定项。

  • 选定一个模型,按参数量与数值位宽估算权重占用;再按层数、上下文长度、批大小估算键值缓存占用。
  • 把两部分相加并留出运行时开销,得到所需显存范围;与至少两款候选硬件的公开容量规格对照并记录来源。
  • 设定一个目标生成速度,反推所需的访存带宽,与硬件公开带宽规格对照,判断是否可行。
  • 列出估算中的全部不确定项(算子实现、批处理效率、缓存命中、实际并发分布),说明每项可能造成的偏差方向,并写明结论需要实测确认。

自测与答案

第 1 题

高带宽存储的带宽优势主要来自什么结构设计?它带来了什么代价?

尚未检查本题。

查看答案与评价要点

参考答案:来自垂直堆叠多层存储裸片、通过硅通孔连接并与计算裸片在同一封装内紧密耦合,从而使用非常宽且划分为多个独立通道的接口,在同等功耗下获得更高总带宽。代价是必须依赖垂直堆叠、硅通孔与中介层等先进封装工艺,产能扩张周期长,因此存储供给与封装产能实际上是同一个约束。

评价要点:说明垂直堆叠与宽接口获得带宽;提到与计算裸片同封装紧密耦合;指出对先进封装的依赖与产能约束

第 2 题

判断一块加速卡能否运行某个模型时,为什么只看显存容量不够?

尚未检查本题。

查看答案与评价要点

参考答案:容量决定能否放下权重与键值缓存,带宽决定生成速度。解码阶段每产出一个词元都要读一遍权重,因此生成速度大致受带宽限制;容量足够但带宽不足时,模型能加载却达不到可用的生成速度。两项都必须检查,且估算结果应写成范围并以实测确认。

评价要点:区分容量与带宽各自决定什么;说明解码阶段每词元需读取权重;指出估算需给范围并以实测为准

尚未完成自测。

今日完成标准

  • 提交权重与键值缓存的分项估算过程与合计显存需求范围
  • 提交与至少两款硬件公开规格的对照结果,含来源链接与访问日期
  • 提交带宽反推过程与不确定项清单,说明每项的偏差方向

常见错误与纠正提示

  • 只按参数量估算显存,忽略键值缓存在长上下文高并发下的占用
  • 只看算力规格不看带宽,导致模型能加载但生成速度不可用
  • 把估算结果写成单一确定数字,不标注不确定项与实测要求

分层任务

基础任务

使用教师给出的模型参数完成权重占用估算,并说明键值缓存受哪些因素影响。

标准任务

独立完成容量与带宽双重估算,并与两款硬件规格对照。

挑战任务

在可用环境中实测一次显存占用与生成速度,与估算结果对比,分析偏差来源。

关联知识点

延伸阅读

学习状态:未学习

Day 95

AI服务器与超节点

建议时长:75 分钟

本日 CO:CO1 CO7 CO8

本日概要

AI 服务器与通用服务器的差别集中在互连与供电散热。多张加速卡之间需要高带宽低延迟的直连通道,因为分布式训练中的梯度同步会频繁传输大量数据;卡与主机、卡与网络之间的路径同样影响端到端效率。当单机容纳的卡数达到上限后,就要靠机柜内的高速互连把多台机器组织成更大的计算域。这类系统的评价不能只看单卡指标,而要看整机与集群层面的有效算力——通信开销、拓扑结构与故障域划分共同决定了规模扩大时的效率衰减程度。

听书与视频

本日听书

6 分钟 · MP3 · 双主持人讲解

B 站讲解

老张公开课:算力、GPU、AI服务器详解(上)

It_server技术分享 · 已核验 2026-08-29

在 B 站打开

学习目标

  • 能画出多卡服务器内部的计算、互连、存储与网络路径
  • 能说明卡间高速互连对分布式训练效率的作用
  • 能识别整机与机柜层面的供电、散热与故障域约束
  • 能解释规模扩大时通信开销为何会导致效率衰减

核心讲解

互连决定整机效率

在多卡服务器中,加速卡之间通常通过专用的高速互连直连,而不是全部经由通用总线绕行主机。原因是分布式训练在每一步都要同步梯度,通信量与模型规模成正比;若卡间通信要经过主机内存中转,延迟与带宽都会成为瓶颈。理解这一点后就能明白,同样八张卡的两台服务器,因互连拓扑不同,实际训练效率可能相差很多。

拓扑还决定了哪些卡之间通信更快。当拓扑不是全互联时,任务切分方式需要与拓扑匹配——把通信频繁的分片放在直连的卡上,否则会产生大量跨跳传输。这类优化属于工程细节,但在大规模训练中影响显著。评估整机时应当索取拓扑图,而不是只看卡的数量与型号。

供电、散热与故障域

高功耗加速卡让整机功率密度大幅上升,随之而来的是三个约束:机柜的供电容量可能装不下满配的服务器数量;风冷的散热能力接近上限时需要考虑液冷,这会改变机房的基础设施要求;持续高负载下的温度控制直接影响是否触发降频。因此机柜规划中「一柜能放几台」的答案往往由供电与散热决定,而不是由物理空间决定。

故障域划分同样重要。同一台服务器内的卡共享主机、电源与散热;同一机柜内的服务器共享配电与交换;同一供电分区内的机柜共享上游电源。大规模训练任务通常跨越多个故障域,任一层的故障都可能导致整个任务中断,因此需要检查点机制与快速恢复能力。规划时应当把故障域画进拓扑图,并明确「某一层失效时,正在运行的任务如何恢复」。

实践任务

拆解一台多卡 AI 服务器的内部路径与机柜级组织方式,标注互连、供电、散热与故障域,并说明扩展时的效率约束。

  • 画出一台多卡服务器的内部路径图:处理器、内存、加速卡、卡间互连、存储与网络接口,标出各段的连接方式。
  • 扩展到机柜层面:加入机柜交换、配电单元与散热方式,标出至少三个共享故障域。
  • 为一个假设的训练任务,说明任务切分应如何与互连拓扑匹配,以及不匹配时会产生什么额外通信。
  • 估算机柜的供电与散热约束下可容纳的服务器数量,说明估算依据;再写出各层故障域失效时任务的恢复方式。

自测与答案

第 1 题

为什么同样配置八张加速卡的两台服务器,实际训练效率可能相差很大?

尚未检查本题。

查看答案与评价要点

参考答案:差别主要来自卡间互连的拓扑与带宽。分布式训练每一步都要同步梯度,通信量随模型规模上升;若卡间通信需经主机内存中转或跨越多跳,延迟与带宽会成为瓶颈。此外任务切分是否与拓扑匹配也会显著影响效率,因此评估整机必须索取拓扑图而非只看卡数与型号。

评价要点:指出互连拓扑与带宽的差异;说明梯度同步的通信需求;提出需索取拓扑图并匹配任务切分

第 2 题

机柜规划中「一柜能放几台服务器」通常由什么决定?

尚未检查本题。

查看答案与评价要点

参考答案:通常由供电容量与散热能力决定,而不是物理空间。高功耗加速卡使整机功率密度大幅上升,机柜的配电容量可能在装满之前就已用尽;风冷散热接近上限时需要改用液冷,这会改变机房基础设施要求。持续高负载下的温度还直接影响是否触发降频。

评价要点:指出供电容量约束;指出散热能力与液冷的影响;指出并非由物理空间决定

尚未完成自测。

今日完成标准

  • 提交整机内部路径图与机柜级扩展图,标出至少三个共享故障域
  • 提交任务切分与拓扑匹配的说明,以及不匹配时的额外通信分析
  • 提交供电散热约束下的容量估算及依据,与各层故障域失效时的恢复方式

常见错误与纠正提示

  • 只看加速卡数量与型号,不核对互连拓扑
  • 按物理空间规划机柜密度,忽略供电与散热上限
  • 不划分故障域,任务中断后无法判断影响范围与恢复方式

分层任务

基础任务

在教师提供的整机图上标出卡间互连路径与三个共享故障域。

标准任务

独立完成整机与机柜两级图、拓扑匹配分析与容量估算。

挑战任务

为一个跨多机柜的训练任务设计检查点与恢复方案,估算不同故障层级下的恢复耗时。

关联知识点

延伸阅读

学习状态:未学习

Day 96

AI数据中心与能源

建议时长:75 分钟

本日 CO:CO1 CO7 CO8

本日概要

AI 数据中心的核心矛盾是功率密度:传统机房按每机柜数千瓦设计,而高密度 AI 机柜的功率可能高出一个数量级,这让供电、散热与机房改造成为主要成本项而非附属项。能效通常用电能使用效率衡量——总用电量与 IT 设备用电量之比,越接近一越好。评估一个 AI 数据中心方案时,除了算力还要回答四个问题:电力容量是否够、散热方式能否支撑目标密度、选址的电价与气候条件如何、以及机房改造或新建的周期是否匹配业务节奏。这四项往往比设备采购更早成为瓶颈。

听书与视频

本日听书

6 分钟 · MP3 · 双主持人讲解

B 站讲解

AI数据中心如何吞噬世界【High Yield】

Tacoma213 · 已核验 2026-08-29

在 B 站打开

学习目标

  • 能说明高功率密度为什么使供电与散热成为主要约束
  • 能解释电能使用效率的定义与它的局限
  • 能列出 AI 数据中心方案必须回答的四个前置问题
  • 能为一个集群规模估算电力与散热需求,并标注不确定项

核心讲解

功率密度改变一切

通用服务器机柜的功率通常在数千瓦量级,机房的配电、母线与散热都是按这个量级设计的。高密度 AI 机柜的功率可能高出一个数量级,这意味着原有机房往往无法直接容纳——不是放不下,而是供不上电、散不掉热。因此把 AI 集群放进既有机房时,通常需要评估改造:配电扩容、母线更换、空调或液冷系统改造,这些工程的周期与成本经常超过设备本身。

散热方式的选择随密度上升而变化。风冷在一定密度以下经济可行,超过之后送风量与温差都难以满足,冷板式或浸没式液冷成为选项,但它们对机房结构、维护流程与运维人员技能都提出新要求。规划时应当把「达到目标密度需要哪种散热方式,以及该方式带来的连锁改造」写清楚,而不是笼统地说「采用先进散热技术」。

能效指标与四个前置问题

电能使用效率是最常用的数据中心能效指标,定义为总用电量与 IT 设备用电量之比,理论下限是一。它的局限在于:只反映基础设施的相对开销,不反映 IT 设备本身是否被高效利用——一个满负荷运行低效模型的机房和一个空转的机房可能有相近的数值。因此评价 AI 数据中心时,应当同时看基础设施能效与算力利用率,前者衡量「电用在哪」,后者衡量「算力用得值不值」。

方案评估应当先回答四个前置问题:电力容量能否申请到并按期到位;散热方式能否支撑目标功率密度,改造涉及哪些系统;选址的电价、气候与网络条件如何,它们直接影响长期运营成本;机房改造或新建的周期是否匹配业务上线节奏。这四项的答案往往比设备选型更早决定方案是否可行,因此应当放在报告最前面,并对每个数字标明来源与核验入口。

实践任务

为一个千卡规模集群列出电力、散热、网络与运维四类需求,估算关键数字并标注不确定项与核验入口。

  • 设定一个千卡规模的集群,按单卡功耗与整机开销估算 IT 设备总功率,再按假设的能效比估算机房总用电功率,写明每个假设的来源。
  • 根据估算的机柜功率密度判断可行的散热方式,列出该方式所需的机房改造项。
  • 列出网络需求:集群内互连、存储访问与外部接入各自的带宽量级与冗余要求。
  • 列出运维需求:监控项、值班与巡检、故障响应流程与备件策略;最后汇总所有易变数字,为每项给出核验入口与本人访问日期,未核验的标为待验证假设。

自测与答案

第 1 题

为什么把 AI 集群放进既有机房时,往往需要评估改造而不能直接部署?

尚未检查本题。

查看答案与评价要点

参考答案:既有机房的配电容量、母线规格与散热能力是按通用服务器的功率密度设计的,而高密度 AI 机柜的功率可能高出一个数量级,问题不是空间放不下,而是供不上电、散不掉热。因此需要评估配电扩容、母线更换与空调或液冷改造,这些工程的周期与成本常常超过设备本身。

评价要点:指出既有机房按低功率密度设计;说明瓶颈在供电与散热而非空间;指出改造周期与成本可能超过设备

第 2 题

电能使用效率这一指标有什么局限?评价 AI 数据中心还应看什么?

尚未检查本题。

查看答案与评价要点

参考答案:它只反映基础设施用电相对 IT 设备用电的开销,不反映 IT 设备本身是否被高效利用:一个满负荷跑低效任务的机房与一个空转机房可能数值相近。评价 AI 数据中心还应看算力利用率——前者衡量电用在哪里,后者衡量算力是否用得值当,两者需并列考察。

评价要点:准确说明该指标的定义范围;指出它不反映算力利用效率;提出并列考察算力利用率

尚未完成自测。

今日完成标准

  • 提交 IT 功率与总用电功率的分项估算过程,每个假设标明来源
  • 提交散热方式判断与所需改造项清单,以及网络与运维需求清单
  • 提交易变数字汇总表,每项含核验入口与访问日期,未核验项被标为待验证假设

常见错误与纠正提示

  • 按物理空间而非供电散热能力规划集群规模
  • 只用能效指标评价数据中心,忽略算力利用率
  • 把电价、容量等易变数字写成确定值,不给核验入口

分层任务

基础任务

在教师给出的单卡功耗数据上完成 IT 总功率估算,并说明散热方式的选择依据。

标准任务

独立完成四类需求清单与完整估算,并标注全部不确定项。

挑战任务

对比风冷与液冷两种方案在同一目标密度下的改造项、周期与运维要求,给出选择建议与其成立条件。

关联知识点

延伸阅读

学习状态:未学习

Day 97

高速网络与端侧AI

建议时长:75 分钟

本日 CO:CO1 CO7 CO8

本日概要

集群规模扩大后,网络往往取代单卡算力成为瓶颈。分布式训练的通信模式以集合通信为主,其耗时取决于网络带宽、延迟与拓扑,而不只是链路速率;因此评估集群网络要看端到端的集合通信性能,而非单纯的接口带宽数字。端侧则是另一个极端:算力、内存、功耗与延迟四重受限,模型必须经过压缩与格式转换才能部署。把两端放在一起看,可以得到一个实用的划分原则——延迟敏感、隐私敏感与离线可用的任务留在端侧,需要大模型能力、最新知识或跨用户聚合的任务回到云端,两者通过明确的接口协作。

听书与视频

本日听书

6 分钟 · MP3 · 双主持人讲解

B 站讲解

【RDMA深度科普】高效通信三剑客:RDMA与RoCE、InfiniBand入门解读!

云计算科普研究所 · 已核验 2026-08-29

在 B 站打开

学习目标

  • 能说明集合通信的耗时受哪些因素影响,以及为何不能只看链路速率
  • 能识别集群规模扩大时通信开销导致的效率衰减
  • 能按延迟、隐私、离线三个维度划分端云任务边界
  • 能说明端侧部署所需的压缩与格式转换步骤及其验证要求

核心讲解

集群网络看端到端

分布式训练中最常见的通信是集合操作——所有参与节点共同完成一次数据聚合或分发。它的耗时不只取决于链路速率,还受拓扑结构、算法实现、消息大小与网络拥塞影响:同样的链路带宽,在不同拓扑下完成一次全局聚合的时间可能相差明显。因此评估集群网络应当实测端到端的集合通信耗时随节点数变化的曲线,而不是比较接口的标称速率。

规模扩大时的效率衰减也来自这里。理想情况下节点翻倍应当让训练时间减半,实际上通信开销占比会随规模上升,最终出现加速比明显低于线性的现象。规划集群时应当先在小规模上测出加速比曲线,据此估计目标规模下的实际效率,而不是按线性外推。这条曲线也是判断「继续加节点是否划算」的直接依据。

端侧的四重约束与协作边界

端侧设备同时受算力、内存、功耗与延迟四方面限制,且四者互相牵制。因此模型通常需要经过量化、剪枝或蒸馏压缩,再导出为中间表示并转换为目标平台的推理格式。转换过程可能遇到算子不支持或数值差异,必须用一批固定输入做转换前后的一致性验证并设定可接受阈值——这一步在前面几周已经强调过,在硬件专题里同样适用。

端云划分的三条判据是:延迟敏感的任务放端侧,因为网络往返本身可能超出预算;隐私敏感的任务放端侧,可以让原始数据不出设备;离线可用要求高的场景必须端侧,否则断网即失效。反之,需要大模型能力、需要最新知识或需要跨用户聚合的任务应当回云端。两侧之间要定义清楚接口:端侧上传什么(尽量是处理后的特征而非原始数据)、云端返回什么、以及网络不可用时端侧的降级行为。

实践任务

为一个端云协同应用划分任务边界,并分别说明集群侧的通信约束与端侧的四重约束如何影响设计。

  • 为一个分布式训练场景说明其主要集合通信模式,列出影响其耗时的四类因素。
  • 若条件允许,在两种节点规模下实测一次集合通信耗时并计算加速比;条件不足时用教师提供的数据完成曲线分析。
  • 选定一个端云协同应用,按延迟、隐私、离线三条判据划分任务边界,逐项写明判断理由。
  • 为端侧部分说明压缩与转换步骤及一致性验证方案;定义端云接口的上传内容、返回内容与断网时的降级行为。

自测与答案

第 1 题

评估集群网络时,为什么不能只比较接口的标称带宽?

尚未检查本题。

查看答案与评价要点

参考答案:分布式训练的主要通信是集合操作,其耗时还受拓扑结构、通信算法实现、消息大小与网络拥塞影响;同样的链路带宽在不同拓扑下完成一次全局聚合的时间可能明显不同。应当实测端到端的集合通信耗时随节点数变化的曲线,据此判断实际效率。

评价要点:指出集合通信是主要模式;列出拓扑、算法或拥塞等额外因素;提出实测端到端耗时曲线

第 2 题

为什么规划集群规模时不能按线性外推加速比?

尚未检查本题。

查看答案与评价要点

参考答案:通信开销占比会随节点数上升,导致加速比低于线性,规模越大衰减越明显。正确做法是先在小规模上实测加速比曲线,据此估计目标规模下的实际效率,并用这条曲线判断继续增加节点是否划算,而不是假设节点翻倍训练时间减半。

评价要点:指出通信开销占比随规模上升;说明加速比低于线性;提出用小规模实测曲线外推并判断投入价值

尚未完成自测。

今日完成标准

  • 提交集合通信影响因素分析与加速比曲线(实测或基于教师数据)
  • 提交端云任务划分表,三条判据逐项给出判断理由
  • 提交端侧压缩转换方案与一致性验证设计,以及端云接口与断网降级行为定义

常见错误与纠正提示

  • 按接口标称带宽评估集群网络能力
  • 按线性外推估计大规模集群的训练效率
  • 端云划分以「能放端侧就放端侧」为原则,忽略最新知识与聚合类需求

分层任务

基础任务

使用教师提供的通信数据完成加速比曲线分析,并说出衰减原因。

标准任务

独立完成通信分析、端云划分与端侧转换验证方案。

挑战任务

为端云接口设计一份隐私边界说明:明确哪些数据不得离开设备、哪些经处理后可上传,并给出验证方式。

关联知识点

延伸阅读

学习状态:未学习

Day 98

AI硬件选型复盘

建议时长:75 分钟

本日 CO:CO1 CO7 CO8

本日概要

本周收尾要产出一份可复核的硬件选型表。合理的结构是先按用途分场景——训练集群、在线推理、端侧设备三类的约束完全不同,不应共用一套标准;再为每个场景列出必须回答的问题:容量与带宽是否满足、软件生态与迁移成本如何、供电散热与机房条件是否具备、以及采购与交付周期能否匹配业务节奏。选型表的价值在于让判断可被他人复核,因此每一项都要写清依据来源,并把价格、产能、交付周期这类易变信息标记为需要在实际采购时重新核验的假设。

听书与视频

本日听书

6 分钟 · MP3 · 双主持人讲解

B 站讲解

都是处理器!CPU GPU NPU的区别到底是什么?

工科男孙老师 · 已核验 2026-08-29

在 B 站打开

学习目标

  • 能按训练、在线推理、端侧三类场景分别组织硬件选型标准
  • 能为每个场景列出必须回答的关键问题并给出判断依据
  • 能区分稳定的机制性结论与易变的市场信息,并分别处理
  • 能产出一份他人可按同样依据复核的选型表

核心讲解

三类场景,三套标准

训练集群关注的是规模扩展效率:卡间互连拓扑、集合通信性能、加速比曲线、以及大规模下的故障恢复能力;单卡峰值反而不是决定性因素。在线推理关注的是显存容量与访存带宽能否支撑目标并发与生成速度,以及服务的延迟分位数是否稳定;这里成本敏感度通常更高,量化与批处理策略的影响也更大。端侧关注的是算力、内存、功耗与延迟四重约束下的可行性,以及模型转换后的一致性。

三类场景共用一套标准会导致明显的误判——用训练集群的标准评估端侧设备,会得出「算力严重不足」这种没有意义的结论;用端侧的成本敏感度看训练集群,又会低估互连投入的必要性。因此选型表的第一层结构应当是场景,而不是产品。

让判断可被复核

选型表的每一行都应当包含四列:判断项、结论、依据、来源。依据要写清是本人实测、官方规格文档、还是第三方报道;来源要给出可回查的位置与访问日期。这样别人可以顺着同样的依据重走一遍,得出相同或不同的结论——不同也没关系,重要的是分歧点能被定位到具体的依据上,而不是停留在观点之争。

价格、产能、交付周期与市场供给状况变化很快,写死在表里会让整份文档迅速过期。更稳妥的做法是把这类信息单列一节,记录当前了解到的情况、信息来源与获取日期,并明确标注「采购决策前需重新核验」。相对稳定的是机制性结论——访存带宽决定生成速度、通信开销随规模上升、生态迁移成本需实测——这些可以放心写进主表。

实践任务

编制三场景硬件选型表,逐项给出判断依据与来源,并单列需要重新核验的易变信息。

  • 为训练集群、在线推理、端侧设备三类场景分别列出五到八个必须回答的判断项。
  • 为每个判断项填写结论、依据与来源四列,依据类型标注为实测、官方文档或待验证。
  • 把价格、产能、交付周期等易变信息单列一节,记录当前情况、来源与获取日期,并标注需重新核验。
  • 请同伴按你的依据复核其中一个场景的结论,记录分歧点及其定位到的具体依据,并据此修订选型表。

自测与答案

第 1 题

为什么硬件选型表的第一层结构应当是使用场景而不是产品?

尚未检查本题。

查看答案与评价要点

参考答案:训练集群、在线推理与端侧设备的约束完全不同:训练看规模扩展效率与互连,推理看容量带宽与延迟稳定性,端侧看四重资源约束下的可行性。共用一套标准会产生无意义的比较,例如用训练标准评估端侧设备只会得出算力严重不足这类结论。按场景分层后,每类才有对应且可比的判断项。

评价要点:指出三类场景的关注点不同;举出共用标准导致的误判;得出按场景分层的结论

第 2 题

选型表中应如何处理价格、产能与交付周期这类信息?

尚未检查本题。

查看答案与评价要点

参考答案:应当单列一节,记录当前了解到的情况、信息来源与获取日期,并明确标注采购决策前需重新核验,而不是写进主表当作确定结论。这类信息变化快,写死会让整份文档迅速过期;主表应保留访存带宽决定生成速度、通信开销随规模上升等相对稳定的机制性结论。

评价要点:要求单列并标注需重新核验;记录来源与获取日期;区分易变信息与稳定的机制性结论

尚未完成自测。

今日完成标准

  • 提交三场景选型表,每场景五到八个判断项,四列齐全
  • 依据类型逐项标注为实测、官方文档或待验证,来源含访问日期
  • 提交易变信息单列节与同伴复核记录,含分歧点定位与修订说明

常见错误与纠正提示

  • 三类场景共用一套标准,产生无意义的横向比较
  • 结论只写判断不写依据来源,他人无法复核
  • 把价格与交付周期写进主表,文档很快过期

分层任务

基础任务

在教师给出的判断项清单上完成一个场景的结论与依据填写。

标准任务

独立完成三场景选型表与同伴复核修订。

挑战任务

为其中一个场景补充一份「否决方案清单」:列出两个看似合适但应被排除的方案,并说明是哪个判断项把它们排除的。

关联知识点

延伸阅读

学习状态:未学习