第 1 题
评估“Flash Attention”时,第一步最应该做什么?
尚未检查本题。
查看答案与评价要点
参考答案:先定位Flash Attention要解决的瓶颈,并定义可测成功指标
解析:Flash Attention只有针对真实瓶颈并用明确指标验证,结论才有意义。
浏览器未允许保存进度;当前为只读学习模式。
第 18 周 · 进阶
从注意力、路由与压缩理解模型效率
周目标:比较注意力、路由、解码与蒸馏方案的边界
课程成果:CO3 CO4 CO8
已学习 0 / 7 天
Day 120
建议时长:60 分钟
本日 CO:CO3 CO8
先说人话:标准注意力慢的不只是乘法,还因为中间注意力矩阵反复写入和读取显存。标准注意力慢的不只是乘法,还因为中间注意力矩阵反复写入和读取显存。Flash Attention 分块计算并在线归一化,减少高带宽内存 IO,同时保持精确注意力结果。它没有把注意力理论计算量从平方级变成线性级;收益依赖序列长度、硬件、数据类型和内核支持。短序列上启动开销可能盖过收益。学习Flash Attention时,要把机制图、对照实验和失败案例放在一起:先证明瓶颈存在,再证明改动确实改善目标指标,最后确认没有把代价转移到质量、安全或其他资源。
4 分钟 · MP3 · 双主持人讲解
先说人话:标准注意力慢的不只是乘法,还因为中间注意力矩阵反复写入和读取显存。
学习Flash Attention先明确它解决的瓶颈,再判断是否值得引入;名称相似不代表机制相同。
标准注意力慢的不只是乘法,还因为中间注意力矩阵反复写入和读取显存。Flash Attention 分块计算并在线归一化,减少高带宽内存 IO,同时保持精确注意力结果。
分析Flash Attention时沿输入、状态、计算或检索、输出四步画数据流,并把成本落到时间、显存、带宽或质量指标。
它没有把注意力理论计算量从平方级变成线性级;收益依赖序列长度、硬件、数据类型和内核支持。短序列上启动开销可能盖过收益。
评价Flash Attention必须附工作负载、硬件或模型、版本和测量口径;没有这些条件的“更快”“更准”不能直接用于选型。
把Flash Attention放进真实系统前,先保存未改动方案的原始数据,再按单一变量引入改动。评估Flash Attention不能只看平均值,还要记录尾延迟、资源峰值、异常输入和失败恢复。
复盘Flash Attention实验时,要能回答三个问题:改善来自哪一步,代价转移到了哪里,指标不达标时如何停止并回滚。这样得到的Flash Attention结论不是一张漂亮截图,而是一份别人可以复核的工程证据。最后还要把Flash Attention的配置、版本、样本和原始输出一起保存,确保换一个人也能重复同样的检查。
上线前再为Flash Attention安排一次反向评审:让没有参与实现的人只看记录复现实验,并主动寻找会推翻结论的输入。如果Flash Attention复现失败,就先补证据而不是扩大部署范围。
在三种序列长度上比较普通 SDPA 与 Flash 后端的时间和峰值显存。
评估“Flash Attention”时,第一步最应该做什么?
尚未检查本题。
参考答案:先定位Flash Attention要解决的瓶颈,并定义可测成功指标
解析:Flash Attention只有针对真实瓶颈并用明确指标验证,结论才有意义。
为什么不能看到“Flash Attention”就断言系统一定更快或更好?
尚未检查本题。
参考答案:因为Flash Attention的收益依赖工作负载、实现和测量条件,还可能引入额外代价
解析:它没有把注意力理论计算量从平方级变成线性级;收益依赖序列长度、硬件、数据类型和内核支持。短序列上启动开销可能盖过收益。
验证“Flash Attention”的最小实验应包含哪些要素?(多选)
尚未检查本题。
参考答案:为Flash Attention建立未改动基线或对照组;验证Flash Attention时每轮固定其他变量;同时记录Flash Attention的质量、延迟和资源指标
解析:在三种序列长度上比较普通 SDPA 与 Flash 后端的时间和峰值显存。
尚未完成自测。
画一张Flash Attention概念图并解释五个关键词。
在三种序列长度上比较普通 SDPA 与 Flash 后端的时间和峰值显存。
为Flash Attention设计一个包含对照组、异常注入和回退条件的评估方案。
学习状态:未学习
Day 121
建议时长:60 分钟
本日 CO:CO3 CO8
先说人话:MHA 每个查询头都有独立 K/V;MQA 让所有查询头共享一组 K/V;GQA 让若干查询头共享一组;MLA 用低秩潜变量压缩并重构注意力所需信息。MHA 每个查询头都有独立 K/V;MQA 让所有查询头共享一组 K/V;GQA 让若干查询头共享一组;MLA 用低秩潜变量压缩并重构注意力所需信息。目标都是减少 KV Cache 和读取带宽。共享越强越省缓存,但质量与兼容性取决于训练方式,不能只在部署时随意把已有 MHA 权重改成 MQA。MLA 的具体实现也不能简单等同于更多共享头。学习GQA/MQA/MLA时,要把机制图、对照实验和失败案例放在一起:先证明瓶颈存在,再证明改动确实改善目标指标,最后确认没有把代价转移到质量、安全或其他资源。
5 分钟 · MP3 · 双主持人讲解
先说人话:MHA 每个查询头都有独立 K/V;MQA 让所有查询头共享一组 K/V;GQA 让若干查询头共享一组;MLA 用低秩潜变量压缩并重构注意力所需信息。
学习GQA/MQA/MLA先明确它解决的瓶颈,再判断是否值得引入;名称相似不代表机制相同。
MHA 每个查询头都有独立 K/V;MQA 让所有查询头共享一组 K/V;GQA 让若干查询头共享一组;MLA 用低秩潜变量压缩并重构注意力所需信息。目标都是减少 KV Cache 和读取带宽。
分析GQA/MQA/MLA时沿输入、状态、计算或检索、输出四步画数据流,并把成本落到时间、显存、带宽或质量指标。
共享越强越省缓存,但质量与兼容性取决于训练方式,不能只在部署时随意把已有 MHA 权重改成 MQA。MLA 的具体实现也不能简单等同于更多共享头。
评价GQA/MQA/MLA必须附工作负载、硬件或模型、版本和测量口径;没有这些条件的“更快”“更准”不能直接用于选型。
把GQA/MQA/MLA放进真实系统前,先保存未改动方案的原始数据,再按单一变量引入改动。评估GQA/MQA/MLA不能只看平均值,还要记录尾延迟、资源峰值、异常输入和失败恢复。
复盘GQA/MQA/MLA实验时,要能回答三个问题:改善来自哪一步,代价转移到了哪里,指标不达标时如何停止并回滚。这样得到的GQA/MQA/MLA结论不是一张漂亮截图,而是一份别人可以复核的工程证据。最后还要把GQA/MQA/MLA的配置、版本、样本和原始输出一起保存,确保换一个人也能重复同样的检查。
上线前再为GQA/MQA/MLA安排一次反向评审:让没有参与实现的人只看记录复现实验,并主动寻找会推翻结论的输入。如果GQA/MQA/MLA复现失败,就先补证据而不是扩大部署范围。
给定头数与维度,计算 MHA、GQA、MQA 的 KV 容量并说明质量风险。
评估“GQA/MQA/MLA”时,第一步最应该做什么?
尚未检查本题。
参考答案:先定位GQA/MQA/MLA要解决的瓶颈,并定义可测成功指标
解析:GQA/MQA/MLA只有针对真实瓶颈并用明确指标验证,结论才有意义。
为什么不能看到“GQA/MQA/MLA”就断言系统一定更快或更好?
尚未检查本题。
参考答案:因为GQA/MQA/MLA的收益依赖工作负载、实现和测量条件,还可能引入额外代价
解析:共享越强越省缓存,但质量与兼容性取决于训练方式,不能只在部署时随意把已有 MHA 权重改成 MQA。MLA 的具体实现也不能简单等同于更多共享头。
验证“GQA/MQA/MLA”的最小实验应包含哪些要素?(多选)
尚未检查本题。
参考答案:为GQA/MQA/MLA建立未改动基线或对照组;验证GQA/MQA/MLA时每轮固定其他变量;同时记录GQA/MQA/MLA的质量、延迟和资源指标
解析:给定头数与维度,计算 MHA、GQA、MQA 的 KV 容量并说明质量风险。
尚未完成自测。
画一张GQA/MQA/MLA概念图并解释五个关键词。
给定头数与维度,计算 MHA、GQA、MQA 的 KV 容量并说明质量风险。
为GQA/MQA/MLA设计一个包含对照组、异常注入和回退条件的评估方案。
学习状态:未学习
Day 122
建议时长:60 分钟
本日 CO:CO3 CO8
先说人话:全注意力让每个 Token 看全部位置。全注意力让每个 Token 看全部位置。稀疏注意力只保留局部窗口、固定全局点或内容选择的连接,用更少计算支持更长序列。稀疏模式会改变信息可达路径;关键信息若不在连接图里,长度再长也看不到。理论稀疏还需要硬件友好的内核才能转成真实加速。学习稀疏注意力时,要把机制图、对照实验和失败案例放在一起:先证明瓶颈存在,再证明改动确实改善目标指标,最后确认没有把代价转移到质量、安全或其他资源。
4 分钟 · MP3 · 双主持人讲解
先说人话:全注意力让每个 Token 看全部位置。
学习稀疏注意力先明确它解决的瓶颈,再判断是否值得引入;名称相似不代表机制相同。
全注意力让每个 Token 看全部位置。稀疏注意力只保留局部窗口、固定全局点或内容选择的连接,用更少计算支持更长序列。
分析稀疏注意力时沿输入、状态、计算或检索、输出四步画数据流,并把成本落到时间、显存、带宽或质量指标。
稀疏模式会改变信息可达路径;关键信息若不在连接图里,长度再长也看不到。理论稀疏还需要硬件友好的内核才能转成真实加速。
评价稀疏注意力必须附工作负载、硬件或模型、版本和测量口径;没有这些条件的“更快”“更准”不能直接用于选型。
把稀疏注意力放进真实系统前,先保存未改动方案的原始数据,再按单一变量引入改动。评估稀疏注意力不能只看平均值,还要记录尾延迟、资源峰值、异常输入和失败恢复。
复盘稀疏注意力实验时,要能回答三个问题:改善来自哪一步,代价转移到了哪里,指标不达标时如何停止并回滚。这样得到的稀疏注意力结论不是一张漂亮截图,而是一份别人可以复核的工程证据。最后还要把稀疏注意力的配置、版本、样本和原始输出一起保存,确保换一个人也能重复同样的检查。
上线前再为稀疏注意力安排一次反向评审:让没有参与实现的人只看记录复现实验,并主动寻找会推翻结论的输入。如果稀疏注意力复现失败,就先补证据而不是扩大部署范围。
为长文档设计滑窗加全局 Token 的连接图,并构造跨窗依赖反例。
评估“稀疏注意力”时,第一步最应该做什么?
尚未检查本题。
参考答案:先定位稀疏注意力要解决的瓶颈,并定义可测成功指标
解析:稀疏注意力只有针对真实瓶颈并用明确指标验证,结论才有意义。
为什么不能看到“稀疏注意力”就断言系统一定更快或更好?
尚未检查本题。
参考答案:因为稀疏注意力的收益依赖工作负载、实现和测量条件,还可能引入额外代价
解析:稀疏模式会改变信息可达路径;关键信息若不在连接图里,长度再长也看不到。理论稀疏还需要硬件友好的内核才能转成真实加速。
验证“稀疏注意力”的最小实验应包含哪些要素?(多选)
尚未检查本题。
参考答案:为稀疏注意力建立未改动基线或对照组;验证稀疏注意力时每轮固定其他变量;同时记录稀疏注意力的质量、延迟和资源指标
解析:为长文档设计滑窗加全局 Token 的连接图,并构造跨窗依赖反例。
尚未完成自测。
画一张稀疏注意力概念图并解释五个关键词。
为长文档设计滑窗加全局 Token 的连接图,并构造跨窗依赖反例。
为稀疏注意力设计一个包含对照组、异常注入和回退条件的评估方案。
学习状态:未学习
Day 123
建议时长:60 分钟
本日 CO:CO3 CO8
先说人话:路由有两层含义:MoE 在一个模型内部按 Token 选择专家;多模型路由在请求层选择不同模型或工具。路由有两层含义:MoE 在一个模型内部按 Token 选择专家;多模型路由在请求层选择不同模型或工具。前者平衡专家容量,后者按质量、成本、时延和权限分流。路由器会犯错,也会造成热门专家或模型过载。必须保留回退、容量因子、质量评估和可观察性,不能只用关键词硬分。学习模型路由时,要把机制图、对照实验和失败案例放在一起:先证明瓶颈存在,再证明改动确实改善目标指标,最后确认没有把代价转移到质量、安全或其他资源。
4 分钟 · MP3 · 双主持人讲解
先说人话:路由有两层含义:MoE 在一个模型内部按 Token 选择专家;多模型路由在请求层选择不同模型或工具。
学习模型路由先明确它解决的瓶颈,再判断是否值得引入;名称相似不代表机制相同。
路由有两层含义:MoE 在一个模型内部按 Token 选择专家;多模型路由在请求层选择不同模型或工具。前者平衡专家容量,后者按质量、成本、时延和权限分流。
分析模型路由时沿输入、状态、计算或检索、输出四步画数据流,并把成本落到时间、显存、带宽或质量指标。
路由器会犯错,也会造成热门专家或模型过载。必须保留回退、容量因子、质量评估和可观察性,不能只用关键词硬分。
评价模型路由必须附工作负载、硬件或模型、版本和测量口径;没有这些条件的“更快”“更准”不能直接用于选型。
把模型路由放进真实系统前,先保存未改动方案的原始数据,再按单一变量引入改动。评估模型路由不能只看平均值,还要记录尾延迟、资源峰值、异常输入和失败恢复。
复盘模型路由实验时,要能回答三个问题:改善来自哪一步,代价转移到了哪里,指标不达标时如何停止并回滚。这样得到的模型路由结论不是一张漂亮截图,而是一份别人可以复核的工程证据。最后还要把模型路由的配置、版本、样本和原始输出一起保存,确保换一个人也能重复同样的检查。
上线前再为模型路由安排一次反向评审:让没有参与实现的人只看记录复现实验,并主动寻找会推翻结论的输入。如果模型路由复现失败,就先补证据而不是扩大部署范围。
制作一个五类请求集,比较规则路由与学习路由的准确率、成本和回退率。
评估“模型路由”时,第一步最应该做什么?
尚未检查本题。
参考答案:先定位模型路由要解决的瓶颈,并定义可测成功指标
解析:模型路由只有针对真实瓶颈并用明确指标验证,结论才有意义。
为什么不能看到“模型路由”就断言系统一定更快或更好?
尚未检查本题。
参考答案:因为模型路由的收益依赖工作负载、实现和测量条件,还可能引入额外代价
解析:路由器会犯错,也会造成热门专家或模型过载。必须保留回退、容量因子、质量评估和可观察性,不能只用关键词硬分。
验证“模型路由”的最小实验应包含哪些要素?(多选)
尚未检查本题。
参考答案:为模型路由建立未改动基线或对照组;验证模型路由时每轮固定其他变量;同时记录模型路由的质量、延迟和资源指标
解析:制作一个五类请求集,比较规则路由与学习路由的准确率、成本和回退率。
尚未完成自测。
画一张模型路由概念图并解释五个关键词。
制作一个五类请求集,比较规则路由与学习路由的准确率、成本和回退率。
为模型路由设计一个包含对照组、异常注入和回退条件的评估方案。
学习状态:未学习
Day 124
建议时长:60 分钟
本日 CO:CO3 CO8
先说人话:训练结束后仍可在回答时投入更多计算:多次采样、搜索候选、调用验证器或延长推理轨迹,再选择更可靠结果。训练结束后仍可在回答时投入更多计算:多次采样、搜索候选、调用验证器或延长推理轨迹,再选择更可靠结果。这叫把预算从训练期移到推理期。更多计算存在收益递减,验证器也可能偏置或被欺骗。简单任务盲目增加采样只会增加成本和延迟,应按难度动态分配预算。学习推理时扩展时,要把机制图、对照实验和失败案例放在一起:先证明瓶颈存在,再证明改动确实改善目标指标,最后确认没有把代价转移到质量、安全或其他资源。
5 分钟 · MP3 · 双主持人讲解
先说人话:训练结束后仍可在回答时投入更多计算:多次采样、搜索候选、调用验证器或延长推理轨迹,再选择更可靠结果。
学习推理时扩展先明确它解决的瓶颈,再判断是否值得引入;名称相似不代表机制相同。
训练结束后仍可在回答时投入更多计算:多次采样、搜索候选、调用验证器或延长推理轨迹,再选择更可靠结果。这叫把预算从训练期移到推理期。
分析推理时扩展时沿输入、状态、计算或检索、输出四步画数据流,并把成本落到时间、显存、带宽或质量指标。
更多计算存在收益递减,验证器也可能偏置或被欺骗。简单任务盲目增加采样只会增加成本和延迟,应按难度动态分配预算。
评价推理时扩展必须附工作负载、硬件或模型、版本和测量口径;没有这些条件的“更快”“更准”不能直接用于选型。
把推理时扩展放进真实系统前,先保存未改动方案的原始数据,再按单一变量引入改动。评估推理时扩展不能只看平均值,还要记录尾延迟、资源峰值、异常输入和失败恢复。
复盘推理时扩展实验时,要能回答三个问题:改善来自哪一步,代价转移到了哪里,指标不达标时如何停止并回滚。这样得到的推理时扩展结论不是一张漂亮截图,而是一份别人可以复核的工程证据。最后还要把推理时扩展的配置、版本、样本和原始输出一起保存,确保换一个人也能重复同样的检查。
上线前再为推理时扩展安排一次反向评审:让没有参与实现的人只看记录复现实验,并主动寻找会推翻结论的输入。如果推理时扩展复现失败,就先补证据而不是扩大部署范围。
在一组可自动判分任务上绘制采样次数与正确率、成本、延迟的曲线。
评估“推理时扩展”时,第一步最应该做什么?
尚未检查本题。
参考答案:先定位推理时扩展要解决的瓶颈,并定义可测成功指标
解析:推理时扩展只有针对真实瓶颈并用明确指标验证,结论才有意义。
为什么不能看到“推理时扩展”就断言系统一定更快或更好?
尚未检查本题。
参考答案:因为推理时扩展的收益依赖工作负载、实现和测量条件,还可能引入额外代价
解析:更多计算存在收益递减,验证器也可能偏置或被欺骗。简单任务盲目增加采样只会增加成本和延迟,应按难度动态分配预算。
验证“推理时扩展”的最小实验应包含哪些要素?(多选)
尚未检查本题。
参考答案:为推理时扩展建立未改动基线或对照组;验证推理时扩展时每轮固定其他变量;同时记录推理时扩展的质量、延迟和资源指标
解析:在一组可自动判分任务上绘制采样次数与正确率、成本、延迟的曲线。
尚未完成自测。
画一张推理时扩展概念图并解释五个关键词。
在一组可自动判分任务上绘制采样次数与正确率、成本、延迟的曲线。
为推理时扩展设计一个包含对照组、异常注入和回退条件的评估方案。
学习状态:未学习
Day 125
建议时长:60 分钟
本日 CO:CO3 CO8
先说人话:Tokenizer 把文本变成模型认识的整数序列。Tokenizer 把文本变成模型认识的整数序列。词表、归一化、预分词和合并规则决定同一文本如何切分;BOS、EOS、PAD 与对话边界等特殊 Token 还承担控制协议。字符数不等于 Token 数,中英文和代码差异很大。新增特殊 Token 后若不调整模型嵌入或聊天模板,可能出现越界、误终止或角色串线。学习Tokenizer 与特殊 Token时,要把机制图、对照实验和失败案例放在一起:先证明瓶颈存在,再证明改动确实改善目标指标,最后确认没有把代价转移到质量、安全或其他资源。
5 分钟 · MP3 · 双主持人讲解
先说人话:Tokenizer 把文本变成模型认识的整数序列。
学习Tokenizer 与特殊 Token先明确它解决的瓶颈,再判断是否值得引入;名称相似不代表机制相同。
Tokenizer 把文本变成模型认识的整数序列。词表、归一化、预分词和合并规则决定同一文本如何切分;BOS、EOS、PAD 与对话边界等特殊 Token 还承担控制协议。
分析Tokenizer 与特殊 Token时沿输入、状态、计算或检索、输出四步画数据流,并把成本落到时间、显存、带宽或质量指标。
字符数不等于 Token 数,中英文和代码差异很大。新增特殊 Token 后若不调整模型嵌入或聊天模板,可能出现越界、误终止或角色串线。
评价Tokenizer 与特殊 Token必须附工作负载、硬件或模型、版本和测量口径;没有这些条件的“更快”“更准”不能直接用于选型。
把Tokenizer 与特殊 Token放进真实系统前,先保存未改动方案的原始数据,再按单一变量引入改动。评估Tokenizer 与特殊 Token不能只看平均值,还要记录尾延迟、资源峰值、异常输入和失败恢复。
复盘Tokenizer 与特殊 Token实验时,要能回答三个问题:改善来自哪一步,代价转移到了哪里,指标不达标时如何停止并回滚。这样得到的Tokenizer 与特殊 Token结论不是一张漂亮截图,而是一份别人可以复核的工程证据。最后还要把Tokenizer 与特殊 Token的配置、版本、样本和原始输出一起保存,确保换一个人也能重复同样的检查。
上线前再为Tokenizer 与特殊 Token安排一次反向评审:让没有参与实现的人只看记录复现实验,并主动寻找会推翻结论的输入。如果Tokenizer 与特殊 Token复现失败,就先补证据而不是扩大部署范围。
比较中英文、代码和表格的 Token 数,并验证 BOS/EOS/PAD 在模板中的位置。
评估“Tokenizer 与特殊 Token”时,第一步最应该做什么?
尚未检查本题。
参考答案:先定位Tokenizer 与特殊 Token要解决的瓶颈,并定义可测成功指标
解析:Tokenizer 与特殊 Token只有针对真实瓶颈并用明确指标验证,结论才有意义。
为什么不能看到“Tokenizer 与特殊 Token”就断言系统一定更快或更好?
尚未检查本题。
参考答案:因为Tokenizer 与特殊 Token的收益依赖工作负载、实现和测量条件,还可能引入额外代价
解析:字符数不等于 Token 数,中英文和代码差异很大。新增特殊 Token 后若不调整模型嵌入或聊天模板,可能出现越界、误终止或角色串线。
验证“Tokenizer 与特殊 Token”的最小实验应包含哪些要素?(多选)
尚未检查本题。
参考答案:为Tokenizer 与特殊 Token建立未改动基线或对照组;验证Tokenizer 与特殊 Token时每轮固定其他变量;同时记录Tokenizer 与特殊 Token的质量、延迟和资源指标
解析:比较中英文、代码和表格的 Token 数,并验证 BOS/EOS/PAD 在模板中的位置。
尚未完成自测。
画一张Tokenizer 与特殊 Token概念图并解释五个关键词。
比较中英文、代码和表格的 Token 数,并验证 BOS/EOS/PAD 在模板中的位置。
为Tokenizer 与特殊 Token设计一个包含对照组、异常注入和回退条件的评估方案。
学习状态:未学习
Day 126
建议时长:60 分钟
本日 CO:CO3 CO8
先说人话:蒸馏让学生模型学习教师的软分布、隐藏表示或教师生成的数据,而不只是硬标签。蒸馏让学生模型学习教师的软分布、隐藏表示或教师生成的数据,而不只是硬标签。软目标能暴露类别之间的相似关系,常用于压缩成本与延迟。学生容量决定可吸收的信息上限;教师错误也会被继承。只在教师生成数据上评估会形成闭环自证,必须保留独立真实测试集。学习模型蒸馏时,要把机制图、对照实验和失败案例放在一起:先证明瓶颈存在,再证明改动确实改善目标指标,最后确认没有把代价转移到质量、安全或其他资源。
4 分钟 · MP3 · 双主持人讲解
[知识蒸馏][01] 耗时两天半,完全从零开始实现大模型知识蒸馏(Qwen2.5系列模型),从原理讲解、代码实现到效果测试,绝对让你搞懂模型蒸馏
偷星九月333 · 已核验 2026-08-31
先说人话:蒸馏让学生模型学习教师的软分布、隐藏表示或教师生成的数据,而不只是硬标签。
学习模型蒸馏先明确它解决的瓶颈,再判断是否值得引入;名称相似不代表机制相同。
蒸馏让学生模型学习教师的软分布、隐藏表示或教师生成的数据,而不只是硬标签。软目标能暴露类别之间的相似关系,常用于压缩成本与延迟。
分析模型蒸馏时沿输入、状态、计算或检索、输出四步画数据流,并把成本落到时间、显存、带宽或质量指标。
学生容量决定可吸收的信息上限;教师错误也会被继承。只在教师生成数据上评估会形成闭环自证,必须保留独立真实测试集。
评价模型蒸馏必须附工作负载、硬件或模型、版本和测量口径;没有这些条件的“更快”“更准”不能直接用于选型。
把模型蒸馏放进真实系统前,先保存未改动方案的原始数据,再按单一变量引入改动。评估模型蒸馏不能只看平均值,还要记录尾延迟、资源峰值、异常输入和失败恢复。
复盘模型蒸馏实验时,要能回答三个问题:改善来自哪一步,代价转移到了哪里,指标不达标时如何停止并回滚。这样得到的模型蒸馏结论不是一张漂亮截图,而是一份别人可以复核的工程证据。最后还要把模型蒸馏的配置、版本、样本和原始输出一起保存,确保换一个人也能重复同样的检查。
上线前再为模型蒸馏安排一次反向评审:让没有参与实现的人只看记录复现实验,并主动寻找会推翻结论的输入。如果模型蒸馏复现失败,就先补证据而不是扩大部署范围。
训练一个小学生模型,对比硬标签、软目标和混合损失,并做独立误差分析。
评估“模型蒸馏”时,第一步最应该做什么?
尚未检查本题。
参考答案:先定位模型蒸馏要解决的瓶颈,并定义可测成功指标
解析:模型蒸馏只有针对真实瓶颈并用明确指标验证,结论才有意义。
为什么不能看到“模型蒸馏”就断言系统一定更快或更好?
尚未检查本题。
参考答案:因为模型蒸馏的收益依赖工作负载、实现和测量条件,还可能引入额外代价
解析:学生容量决定可吸收的信息上限;教师错误也会被继承。只在教师生成数据上评估会形成闭环自证,必须保留独立真实测试集。
验证“模型蒸馏”的最小实验应包含哪些要素?(多选)
尚未检查本题。
参考答案:为模型蒸馏建立未改动基线或对照组;验证模型蒸馏时每轮固定其他变量;同时记录模型蒸馏的质量、延迟和资源指标
解析:训练一个小学生模型,对比硬标签、软目标和混合损失,并做独立误差分析。
尚未完成自测。
画一张模型蒸馏概念图并解释五个关键词。
训练一个小学生模型,对比硬标签、软目标和混合损失,并做独立误差分析。
为模型蒸馏设计一个包含对照组、异常注入和回退条件的评估方案。
学习状态:未学习