第 1 题
为什么分析 AI 硬件产业链时不能只关注芯片设计这一层?
尚未检查本题。
查看答案与评价要点
参考答案:整条链是串行依赖,产出受最紧的一环限制。芯片设计能力充足时,先进封装产能、高带宽存储供给或软件生态成熟度都可能成为实际瓶颈。只看单层的技术进展会得出与实际供给不符的判断,必须逐层核对相邻层的供需匹配情况。
评价要点:指出串行依赖与最紧环节决定产出;举出封装、存储或生态等其他层的约束;强调需逐层核对供需匹配
浏览器未允许保存进度;当前为只读学习模式。
第 14 周 · 专题
从芯片、封装、HBM到数据中心与边缘终端
周目标:建立AI硬件7层产业链视角,能判断算力供给、成本、瓶颈与国产替代路径
课程成果:CO7 CO8
已学习 0 / 7 天
Day 92
建议时长:75 分钟
本日 CO:CO1 CO7 CO8
把 AI 硬件按层拆开,是为了让「算力从哪来、卡在哪里」这个问题有结构化的答案。自下而上大致是:材料与设备、晶圆制造、芯片设计、先进封装与存储、板卡与整机、网络与数据中心、以及上层的软件栈与生态。每一层都有自己的产能约束与技术门槛,而整条链的产出受最紧的那一环限制。分析时要避免两个常见错误:一是只盯芯片设计而忽略封装与存储的产能,二是把软件生态当作附属品——迁移成本往往才是实际选型中最重的一项。
6 分钟 · MP3 · 双主持人讲解
最底层是材料与制造设备,它决定了先进制程能否量产;往上是晶圆制造,把设计变成实际的芯片;再往上是芯片设计,包括处理器、加速器与配套的接口逻辑。封装与存储层近年成为关键:高带宽存储通过垂直堆叠与靠近计算die布置,把访存带宽提上来,而这依赖先进封装工艺。再往上是板卡与整机,涉及供电、散热与互连;然后是机柜、网络与数据中心;最上层是编译器、运行时、框架与算子库构成的软件栈。
各层之间是串行依赖:任一层的产能或良率不足,都会成为整条链的上限。这解释了一个常见现象——芯片设计能力并不稀缺,但先进封装与高带宽存储的产能在某些时期成为实际瓶颈。因此分析产业链时不能只看某一层的技术新闻,而要问「这一层的产出能否匹配相邻层的需求」,并尽量找到可回查的公开数据支撑判断。
技术门槛指的是能否做出来,例如先进制程的工艺能力;产能约束指的是能做多少,例如封装产线的月产能;生态门槛指的是做出来之后能否被用起来,例如算子覆盖度、框架适配与已有代码的迁移成本。三者性质不同,缓解路径也不同:技术门槛靠研发突破,产能约束靠投资与时间,生态门槛靠长期的工具链建设与社区积累。
实际选型中,生态门槛常常是最被低估的一项。一块峰值算力很高的加速卡,如果关键算子缺失、框架版本适配滞后、或调试工具不成熟,团队实际能拿到的有效算力会远低于标称值,迁移过程中的人力投入也很难提前估准。因此产业链分析的结论里,应当把「迁移成本」作为一个显式条目,而不是笼统地说「生态还需完善」。
画一张 AI 硬件分层图,逐层标注关键环节、代表性技术门槛与当前公开可查的瓶颈,并注明每条信息的来源与访问日期。
为什么分析 AI 硬件产业链时不能只关注芯片设计这一层?
尚未检查本题。
参考答案:整条链是串行依赖,产出受最紧的一环限制。芯片设计能力充足时,先进封装产能、高带宽存储供给或软件生态成熟度都可能成为实际瓶颈。只看单层的技术进展会得出与实际供给不符的判断,必须逐层核对相邻层的供需匹配情况。
评价要点:指出串行依赖与最紧环节决定产出;举出封装、存储或生态等其他层的约束;强调需逐层核对供需匹配
技术门槛、产能约束与生态门槛有什么区别?为什么必须分开讨论?
尚未检查本题。
参考答案:技术门槛是能否做出来,产能约束是能做多少,生态门槛是做出来后能否被有效使用。三者的缓解路径不同:分别对应研发突破、投资与时间、以及长期工具链与社区建设。混为一谈会导致误判解决周期——把生态问题当技术问题,会低估所需的时间与人力投入。
评价要点:准确区分三类壁垒的含义;指出各自的缓解路径不同;说明混淆会导致误判解决周期
尚未完成自测。
在教师提供的分层图骨架上补齐三层的关键环节,并为其中一层找到一条可回查来源。
独立完成七层图、来源标注与三类壁垒对比。
选一层做纵向追踪:整理近两年该层的公开产能或技术进展信息,说明它如何改变整条链的瓶颈位置。
学习状态:未学习
Day 93
建议时长:75 分钟
本日 CO:CO1 CO7 CO8
加速器的路线差异不只在硬件,更在软件栈。同一类矩阵运算,不同厂商用不同的编程模型、编译器与算子库来实现,因此「峰值算力」这个数字无法直接横向比较——真正决定有效算力的是算子覆盖度、编译优化质量与框架适配程度。评估一条技术路线时,应当把问题拆成四项:目标模型的关键算子是否被支持、常用框架的版本适配是否及时、调试与性能分析工具是否可用、以及已有代码的迁移改动量有多大。这四项都需要用自己的模型实测,而不是依据宣传材料判断。
6 分钟 · MP3 · 双主持人讲解
峰值算力是在理想条件下的理论上限:特定精度、特定算子、数据全部就位、无通信开销。真实训练或推理中,数据搬运、算子实现质量、内存带宽与多卡通信都会让实际利用率远低于峰值,且不同硬件的差距模式并不相同。因此把两个厂商的峰值数字相除得出「性能比」,是没有依据的推理。可比较的做法是固定模型、固定精度、固定批大小与数据管道,测端到端的吞吐或延迟,并完整记录测试条件。
软件栈决定了峰值中有多少能被拿到。以主流的通用并行计算平台为例,其编程模型、编译器与算子库经过长期积累,覆盖度与优化质量较高;国产路线以异构计算架构为核心,同样提供了从编程接口到算子库的完整层次。评估时要看的不是「有没有对应的层」,而是「目标模型用到的具体算子是否被高效实现」——缺一个关键算子就可能让整个模型退回到低效路径。
第一项是算子覆盖:列出目标模型用到的算子,逐个确认是否被原生支持,未支持的是否有等价替代及其性能代价。第二项是框架适配:确认所用框架版本是否被官方支持、适配滞后多久、以及升级框架时的兼容性。第三项是工具:性能分析器、调试器、内存诊断是否可用——工具缺失会让性能问题的定位成本急剧上升。第四项是迁移改动量:把一份已有代码实际迁移一遍,统计改动的文件数与行数,比任何估计都准确。
这四项都应当用自己的模型和代码实测,并把结论与测试条件一起记录。厂商提供的基准通常在最有利的配置下取得,与自身场景的差距可能很大。写评估报告时,应当明确区分三类信息:本人实测得到的、官方文档中查证的、以及来自第三方报道尚未核实的——第三类必须标注为待验证。
为一个具体模型评估两条加速器路线的适配情况,逐项记录算子覆盖、框架版本、工具可用性与迁移改动量。
为什么把两款加速卡的峰值算力相除得到的「性能比」没有依据?
尚未检查本题。
参考答案:峰值是理想条件下的理论上限,未计入数据搬运、算子实现质量、内存带宽与多卡通信的影响,而这些因素在不同硬件上的影响模式不同,实际利用率差异很大。可比较的做法是固定模型、精度、批大小与数据管道,测端到端吞吐或延迟并记录完整测试条件。
评价要点:指出峰值是理想条件下的上限;列出数据搬运、算子质量或通信等实际因素;给出固定条件下端到端实测的替代方法
评估一条加速器技术路线时,为什么「迁移改动量」必须实测而不能估计?
尚未检查本题。
参考答案:迁移成本取决于目标模型用到的具体算子、框架版本适配情况与代码中对特定接口的依赖程度,这些因素组合起来的影响很难提前估准;缺一个关键算子就可能导致大范围重写。实际迁移一份代码并统计改动文件数、行数与遇到的问题,比任何估计都可靠,也能暴露文档中没写的细节。
评价要点:指出影响因素组合复杂难以预估;举出关键算子缺失导致大范围改动;提出实际迁移并统计改动量
尚未完成自测。
在教师提供的算子清单上完成一条路线的覆盖确认,并说明未支持算子的影响。
独立完成两条路线的四项评估与实际迁移统计。
对同一模型在两条路线上做固定条件的端到端实测,报告吞吐与利用率,并解释差距主要来自哪一层。
学习状态:未学习
Day 94
建议时长:75 分钟
本日 CO:CO1 CO7 CO8
大模型推理受限于访存而非纯算力,这使存储与封装成为决定性能的关键。高带宽存储通过把多层存储裸片垂直堆叠并与计算裸片紧密耦合,用极宽的接口换取带宽——JEDEC 的相关标准把接口划分为多个独立通道并规定了时序与封装约束。这条路线依赖先进封装工艺,因而把存储供给与封装产能绑在了一起。评估一块加速卡是否适合某个模型时,除了算力还必须看两件事:显存容量能否放下模型权重与键值缓存,以及带宽能否支撑目标的生成速度。
6 分钟 · MP3 · 双主持人讲解
传统存储通过提高频率来增加带宽,代价是功耗与信号完整性压力迅速上升。高带宽存储换了一条路:把多层存储裸片垂直堆叠,通过硅通孔连接,并与计算裸片在同一封装内紧密耦合,从而可以使用非常宽的接口——JEDEC 的规范把接口划分为多个独立通道,每个通道可独立操作。宽而相对低频的设计在同等功耗下提供了更高的总带宽,这正是它成为加速器标配的原因。
代价是它必须依赖先进封装:垂直堆叠、硅通孔与中介层工艺都属于高难度制程,产能扩张周期长。这就把两件事绑在了一起——存储供给的紧张往往同时是封装产能的紧张。分析供给状况时把两者分开看,容易得出片面结论;把它们作为同一个约束来分析,更接近实际。
评估硬件能否跑一个模型,第一步是容量:模型权重按参数量与数值位宽估算,再加上推理时的键值缓存——后者与层数、序列长度、批大小和并发数相关,长上下文高并发场景下它可能超过权重本身。把两部分相加再留出运行时开销,才是实际需要的显存。容量不足时,要么降低并发与上下文,要么量化,要么改用多卡切分,而多卡又会引入通信开销。
第二步是带宽。解码阶段每生成一个词元都需要把模型权重读一遍,因此每秒能生成多少词元大致受「带宽除以每次读取的数据量」限制。用目标生成速度反推所需带宽,再与硬件规格对照,就能在采购前判断可行性。需要强调的是,这类估算给出的是数量级判断而非精确值——实际还受算子实现、批处理效率与缓存命中影响,因此结论应当写成范围并列出不确定项,最终以实测为准。
为一个具体模型估算所需的显存容量与带宽,对照候选硬件的公开规格判断可行性,并说明估算中的不确定项。
高带宽存储的带宽优势主要来自什么结构设计?它带来了什么代价?
尚未检查本题。
参考答案:来自垂直堆叠多层存储裸片、通过硅通孔连接并与计算裸片在同一封装内紧密耦合,从而使用非常宽且划分为多个独立通道的接口,在同等功耗下获得更高总带宽。代价是必须依赖垂直堆叠、硅通孔与中介层等先进封装工艺,产能扩张周期长,因此存储供给与封装产能实际上是同一个约束。
评价要点:说明垂直堆叠与宽接口获得带宽;提到与计算裸片同封装紧密耦合;指出对先进封装的依赖与产能约束
判断一块加速卡能否运行某个模型时,为什么只看显存容量不够?
尚未检查本题。
参考答案:容量决定能否放下权重与键值缓存,带宽决定生成速度。解码阶段每产出一个词元都要读一遍权重,因此生成速度大致受带宽限制;容量足够但带宽不足时,模型能加载却达不到可用的生成速度。两项都必须检查,且估算结果应写成范围并以实测确认。
评价要点:区分容量与带宽各自决定什么;说明解码阶段每词元需读取权重;指出估算需给范围并以实测为准
尚未完成自测。
使用教师给出的模型参数完成权重占用估算,并说明键值缓存受哪些因素影响。
独立完成容量与带宽双重估算,并与两款硬件规格对照。
在可用环境中实测一次显存占用与生成速度,与估算结果对比,分析偏差来源。
学习状态:未学习
Day 95
建议时长:75 分钟
本日 CO:CO1 CO7 CO8
AI 服务器与通用服务器的差别集中在互连与供电散热。多张加速卡之间需要高带宽低延迟的直连通道,因为分布式训练中的梯度同步会频繁传输大量数据;卡与主机、卡与网络之间的路径同样影响端到端效率。当单机容纳的卡数达到上限后,就要靠机柜内的高速互连把多台机器组织成更大的计算域。这类系统的评价不能只看单卡指标,而要看整机与集群层面的有效算力——通信开销、拓扑结构与故障域划分共同决定了规模扩大时的效率衰减程度。
6 分钟 · MP3 · 双主持人讲解
在多卡服务器中,加速卡之间通常通过专用的高速互连直连,而不是全部经由通用总线绕行主机。原因是分布式训练在每一步都要同步梯度,通信量与模型规模成正比;若卡间通信要经过主机内存中转,延迟与带宽都会成为瓶颈。理解这一点后就能明白,同样八张卡的两台服务器,因互连拓扑不同,实际训练效率可能相差很多。
拓扑还决定了哪些卡之间通信更快。当拓扑不是全互联时,任务切分方式需要与拓扑匹配——把通信频繁的分片放在直连的卡上,否则会产生大量跨跳传输。这类优化属于工程细节,但在大规模训练中影响显著。评估整机时应当索取拓扑图,而不是只看卡的数量与型号。
高功耗加速卡让整机功率密度大幅上升,随之而来的是三个约束:机柜的供电容量可能装不下满配的服务器数量;风冷的散热能力接近上限时需要考虑液冷,这会改变机房的基础设施要求;持续高负载下的温度控制直接影响是否触发降频。因此机柜规划中「一柜能放几台」的答案往往由供电与散热决定,而不是由物理空间决定。
故障域划分同样重要。同一台服务器内的卡共享主机、电源与散热;同一机柜内的服务器共享配电与交换;同一供电分区内的机柜共享上游电源。大规模训练任务通常跨越多个故障域,任一层的故障都可能导致整个任务中断,因此需要检查点机制与快速恢复能力。规划时应当把故障域画进拓扑图,并明确「某一层失效时,正在运行的任务如何恢复」。
拆解一台多卡 AI 服务器的内部路径与机柜级组织方式,标注互连、供电、散热与故障域,并说明扩展时的效率约束。
为什么同样配置八张加速卡的两台服务器,实际训练效率可能相差很大?
尚未检查本题。
参考答案:差别主要来自卡间互连的拓扑与带宽。分布式训练每一步都要同步梯度,通信量随模型规模上升;若卡间通信需经主机内存中转或跨越多跳,延迟与带宽会成为瓶颈。此外任务切分是否与拓扑匹配也会显著影响效率,因此评估整机必须索取拓扑图而非只看卡数与型号。
评价要点:指出互连拓扑与带宽的差异;说明梯度同步的通信需求;提出需索取拓扑图并匹配任务切分
机柜规划中「一柜能放几台服务器」通常由什么决定?
尚未检查本题。
参考答案:通常由供电容量与散热能力决定,而不是物理空间。高功耗加速卡使整机功率密度大幅上升,机柜的配电容量可能在装满之前就已用尽;风冷散热接近上限时需要改用液冷,这会改变机房基础设施要求。持续高负载下的温度还直接影响是否触发降频。
评价要点:指出供电容量约束;指出散热能力与液冷的影响;指出并非由物理空间决定
尚未完成自测。
在教师提供的整机图上标出卡间互连路径与三个共享故障域。
独立完成整机与机柜两级图、拓扑匹配分析与容量估算。
为一个跨多机柜的训练任务设计检查点与恢复方案,估算不同故障层级下的恢复耗时。
学习状态:未学习
Day 96
建议时长:75 分钟
本日 CO:CO1 CO7 CO8
AI 数据中心的核心矛盾是功率密度:传统机房按每机柜数千瓦设计,而高密度 AI 机柜的功率可能高出一个数量级,这让供电、散热与机房改造成为主要成本项而非附属项。能效通常用电能使用效率衡量——总用电量与 IT 设备用电量之比,越接近一越好。评估一个 AI 数据中心方案时,除了算力还要回答四个问题:电力容量是否够、散热方式能否支撑目标密度、选址的电价与气候条件如何、以及机房改造或新建的周期是否匹配业务节奏。这四项往往比设备采购更早成为瓶颈。
6 分钟 · MP3 · 双主持人讲解
通用服务器机柜的功率通常在数千瓦量级,机房的配电、母线与散热都是按这个量级设计的。高密度 AI 机柜的功率可能高出一个数量级,这意味着原有机房往往无法直接容纳——不是放不下,而是供不上电、散不掉热。因此把 AI 集群放进既有机房时,通常需要评估改造:配电扩容、母线更换、空调或液冷系统改造,这些工程的周期与成本经常超过设备本身。
散热方式的选择随密度上升而变化。风冷在一定密度以下经济可行,超过之后送风量与温差都难以满足,冷板式或浸没式液冷成为选项,但它们对机房结构、维护流程与运维人员技能都提出新要求。规划时应当把「达到目标密度需要哪种散热方式,以及该方式带来的连锁改造」写清楚,而不是笼统地说「采用先进散热技术」。
电能使用效率是最常用的数据中心能效指标,定义为总用电量与 IT 设备用电量之比,理论下限是一。它的局限在于:只反映基础设施的相对开销,不反映 IT 设备本身是否被高效利用——一个满负荷运行低效模型的机房和一个空转的机房可能有相近的数值。因此评价 AI 数据中心时,应当同时看基础设施能效与算力利用率,前者衡量「电用在哪」,后者衡量「算力用得值不值」。
方案评估应当先回答四个前置问题:电力容量能否申请到并按期到位;散热方式能否支撑目标功率密度,改造涉及哪些系统;选址的电价、气候与网络条件如何,它们直接影响长期运营成本;机房改造或新建的周期是否匹配业务上线节奏。这四项的答案往往比设备选型更早决定方案是否可行,因此应当放在报告最前面,并对每个数字标明来源与核验入口。
为一个千卡规模集群列出电力、散热、网络与运维四类需求,估算关键数字并标注不确定项与核验入口。
为什么把 AI 集群放进既有机房时,往往需要评估改造而不能直接部署?
尚未检查本题。
参考答案:既有机房的配电容量、母线规格与散热能力是按通用服务器的功率密度设计的,而高密度 AI 机柜的功率可能高出一个数量级,问题不是空间放不下,而是供不上电、散不掉热。因此需要评估配电扩容、母线更换与空调或液冷改造,这些工程的周期与成本常常超过设备本身。
评价要点:指出既有机房按低功率密度设计;说明瓶颈在供电与散热而非空间;指出改造周期与成本可能超过设备
电能使用效率这一指标有什么局限?评价 AI 数据中心还应看什么?
尚未检查本题。
参考答案:它只反映基础设施用电相对 IT 设备用电的开销,不反映 IT 设备本身是否被高效利用:一个满负荷跑低效任务的机房与一个空转机房可能数值相近。评价 AI 数据中心还应看算力利用率——前者衡量电用在哪里,后者衡量算力是否用得值当,两者需并列考察。
评价要点:准确说明该指标的定义范围;指出它不反映算力利用效率;提出并列考察算力利用率
尚未完成自测。
在教师给出的单卡功耗数据上完成 IT 总功率估算,并说明散热方式的选择依据。
独立完成四类需求清单与完整估算,并标注全部不确定项。
对比风冷与液冷两种方案在同一目标密度下的改造项、周期与运维要求,给出选择建议与其成立条件。
学习状态:未学习
Day 97
建议时长:75 分钟
本日 CO:CO1 CO7 CO8
集群规模扩大后,网络往往取代单卡算力成为瓶颈。分布式训练的通信模式以集合通信为主,其耗时取决于网络带宽、延迟与拓扑,而不只是链路速率;因此评估集群网络要看端到端的集合通信性能,而非单纯的接口带宽数字。端侧则是另一个极端:算力、内存、功耗与延迟四重受限,模型必须经过压缩与格式转换才能部署。把两端放在一起看,可以得到一个实用的划分原则——延迟敏感、隐私敏感与离线可用的任务留在端侧,需要大模型能力、最新知识或跨用户聚合的任务回到云端,两者通过明确的接口协作。
6 分钟 · MP3 · 双主持人讲解
分布式训练中最常见的通信是集合操作——所有参与节点共同完成一次数据聚合或分发。它的耗时不只取决于链路速率,还受拓扑结构、算法实现、消息大小与网络拥塞影响:同样的链路带宽,在不同拓扑下完成一次全局聚合的时间可能相差明显。因此评估集群网络应当实测端到端的集合通信耗时随节点数变化的曲线,而不是比较接口的标称速率。
规模扩大时的效率衰减也来自这里。理想情况下节点翻倍应当让训练时间减半,实际上通信开销占比会随规模上升,最终出现加速比明显低于线性的现象。规划集群时应当先在小规模上测出加速比曲线,据此估计目标规模下的实际效率,而不是按线性外推。这条曲线也是判断「继续加节点是否划算」的直接依据。
端侧设备同时受算力、内存、功耗与延迟四方面限制,且四者互相牵制。因此模型通常需要经过量化、剪枝或蒸馏压缩,再导出为中间表示并转换为目标平台的推理格式。转换过程可能遇到算子不支持或数值差异,必须用一批固定输入做转换前后的一致性验证并设定可接受阈值——这一步在前面几周已经强调过,在硬件专题里同样适用。
端云划分的三条判据是:延迟敏感的任务放端侧,因为网络往返本身可能超出预算;隐私敏感的任务放端侧,可以让原始数据不出设备;离线可用要求高的场景必须端侧,否则断网即失效。反之,需要大模型能力、需要最新知识或需要跨用户聚合的任务应当回云端。两侧之间要定义清楚接口:端侧上传什么(尽量是处理后的特征而非原始数据)、云端返回什么、以及网络不可用时端侧的降级行为。
为一个端云协同应用划分任务边界,并分别说明集群侧的通信约束与端侧的四重约束如何影响设计。
评估集群网络时,为什么不能只比较接口的标称带宽?
尚未检查本题。
参考答案:分布式训练的主要通信是集合操作,其耗时还受拓扑结构、通信算法实现、消息大小与网络拥塞影响;同样的链路带宽在不同拓扑下完成一次全局聚合的时间可能明显不同。应当实测端到端的集合通信耗时随节点数变化的曲线,据此判断实际效率。
评价要点:指出集合通信是主要模式;列出拓扑、算法或拥塞等额外因素;提出实测端到端耗时曲线
为什么规划集群规模时不能按线性外推加速比?
尚未检查本题。
参考答案:通信开销占比会随节点数上升,导致加速比低于线性,规模越大衰减越明显。正确做法是先在小规模上实测加速比曲线,据此估计目标规模下的实际效率,并用这条曲线判断继续增加节点是否划算,而不是假设节点翻倍训练时间减半。
评价要点:指出通信开销占比随规模上升;说明加速比低于线性;提出用小规模实测曲线外推并判断投入价值
尚未完成自测。
使用教师提供的通信数据完成加速比曲线分析,并说出衰减原因。
独立完成通信分析、端云划分与端侧转换验证方案。
为端云接口设计一份隐私边界说明:明确哪些数据不得离开设备、哪些经处理后可上传,并给出验证方式。
学习状态:未学习
Day 98
建议时长:75 分钟
本日 CO:CO1 CO7 CO8
本周收尾要产出一份可复核的硬件选型表。合理的结构是先按用途分场景——训练集群、在线推理、端侧设备三类的约束完全不同,不应共用一套标准;再为每个场景列出必须回答的问题:容量与带宽是否满足、软件生态与迁移成本如何、供电散热与机房条件是否具备、以及采购与交付周期能否匹配业务节奏。选型表的价值在于让判断可被他人复核,因此每一项都要写清依据来源,并把价格、产能、交付周期这类易变信息标记为需要在实际采购时重新核验的假设。
6 分钟 · MP3 · 双主持人讲解
训练集群关注的是规模扩展效率:卡间互连拓扑、集合通信性能、加速比曲线、以及大规模下的故障恢复能力;单卡峰值反而不是决定性因素。在线推理关注的是显存容量与访存带宽能否支撑目标并发与生成速度,以及服务的延迟分位数是否稳定;这里成本敏感度通常更高,量化与批处理策略的影响也更大。端侧关注的是算力、内存、功耗与延迟四重约束下的可行性,以及模型转换后的一致性。
三类场景共用一套标准会导致明显的误判——用训练集群的标准评估端侧设备,会得出「算力严重不足」这种没有意义的结论;用端侧的成本敏感度看训练集群,又会低估互连投入的必要性。因此选型表的第一层结构应当是场景,而不是产品。
选型表的每一行都应当包含四列:判断项、结论、依据、来源。依据要写清是本人实测、官方规格文档、还是第三方报道;来源要给出可回查的位置与访问日期。这样别人可以顺着同样的依据重走一遍,得出相同或不同的结论——不同也没关系,重要的是分歧点能被定位到具体的依据上,而不是停留在观点之争。
价格、产能、交付周期与市场供给状况变化很快,写死在表里会让整份文档迅速过期。更稳妥的做法是把这类信息单列一节,记录当前了解到的情况、信息来源与获取日期,并明确标注「采购决策前需重新核验」。相对稳定的是机制性结论——访存带宽决定生成速度、通信开销随规模上升、生态迁移成本需实测——这些可以放心写进主表。
编制三场景硬件选型表,逐项给出判断依据与来源,并单列需要重新核验的易变信息。
为什么硬件选型表的第一层结构应当是使用场景而不是产品?
尚未检查本题。
参考答案:训练集群、在线推理与端侧设备的约束完全不同:训练看规模扩展效率与互连,推理看容量带宽与延迟稳定性,端侧看四重资源约束下的可行性。共用一套标准会产生无意义的比较,例如用训练标准评估端侧设备只会得出算力严重不足这类结论。按场景分层后,每类才有对应且可比的判断项。
评价要点:指出三类场景的关注点不同;举出共用标准导致的误判;得出按场景分层的结论
选型表中应如何处理价格、产能与交付周期这类信息?
尚未检查本题。
参考答案:应当单列一节,记录当前了解到的情况、信息来源与获取日期,并明确标注采购决策前需重新核验,而不是写进主表当作确定结论。这类信息变化快,写死会让整份文档迅速过期;主表应保留访存带宽决定生成速度、通信开销随规模上升等相对稳定的机制性结论。
评价要点:要求单列并标注需重新核验;记录来源与获取日期;区分易变信息与稳定的机制性结论
尚未完成自测。
在教师给出的判断项清单上完成一个场景的结论与依据填写。
独立完成三场景选型表与同伴复核修订。
为其中一个场景补充一份「否决方案清单」:列出两个看似合适但应被排除的方案,并说明是哪个判断项把它们排除的。
学习状态:未学习