课程目录

第 18 周 · 进阶

第18周:大模型高级原理

从注意力、路由与压缩理解模型效率

周目标:比较注意力、路由、解码与蒸馏方案的边界

课程成果:CO3 CO4 CO8

已学习 0 / 7 天

本周 7 个学习日

Day 120

Flash Attention

建议时长:60 分钟

本日 CO:CO3 CO8

本日概要

先说人话:标准注意力慢的不只是乘法,还因为中间注意力矩阵反复写入和读取显存。标准注意力慢的不只是乘法,还因为中间注意力矩阵反复写入和读取显存。Flash Attention 分块计算并在线归一化,减少高带宽内存 IO,同时保持精确注意力结果。它没有把注意力理论计算量从平方级变成线性级;收益依赖序列长度、硬件、数据类型和内核支持。短序列上启动开销可能盖过收益。学习Flash Attention时,要把机制图、对照实验和失败案例放在一起:先证明瓶颈存在,再证明改动确实改善目标指标,最后确认没有把代价转移到质量、安全或其他资源。

听书与视频

本日听书

4 分钟 · MP3 · 双主持人讲解

B 站讲解

Flash Attention 为什么那么快?原理讲解

RethinkFun · 已核验 2026-08-31

在 B 站打开

学习目标

  • 能用自己的话解释Flash Attention的工作机制
  • 能识别Flash Attention的适用条件与失败边界
  • 能设计带指标和对照组的验证实验

核心讲解

先说人话

先说人话:标准注意力慢的不只是乘法,还因为中间注意力矩阵反复写入和读取显存。

学习Flash Attention先明确它解决的瓶颈,再判断是否值得引入;名称相似不代表机制相同。

机制拆开

标准注意力慢的不只是乘法,还因为中间注意力矩阵反复写入和读取显存。Flash Attention 分块计算并在线归一化,减少高带宽内存 IO,同时保持精确注意力结果。

分析Flash Attention时沿输入、状态、计算或检索、输出四步画数据流,并把成本落到时间、显存、带宽或质量指标。

边界与取舍

它没有把注意力理论计算量从平方级变成线性级;收益依赖序列长度、硬件、数据类型和内核支持。短序列上启动开销可能盖过收益。

评价Flash Attention必须附工作负载、硬件或模型、版本和测量口径;没有这些条件的“更快”“更准”不能直接用于选型。

落地检查

把Flash Attention放进真实系统前,先保存未改动方案的原始数据,再按单一变量引入改动。评估Flash Attention不能只看平均值,还要记录尾延迟、资源峰值、异常输入和失败恢复。

复盘Flash Attention实验时,要能回答三个问题:改善来自哪一步,代价转移到了哪里,指标不达标时如何停止并回滚。这样得到的Flash Attention结论不是一张漂亮截图,而是一份别人可以复核的工程证据。最后还要把Flash Attention的配置、版本、样本和原始输出一起保存,确保换一个人也能重复同样的检查。

上线前再为Flash Attention安排一次反向评审:让没有参与实现的人只看记录复现实验,并主动寻找会推翻结论的输入。如果Flash Attention复现失败,就先补证据而不是扩大部署范围。

实践任务

在三种序列长度上比较普通 SDPA 与 Flash 后端的时间和峰值显存。

  • 写出问题定义、输入输出与成功指标。
  • 画出数据流并标出主要状态、计算和外部依赖。
  • 在三种序列长度上比较普通 SDPA 与 Flash 后端的时间和峰值显存。
  • 记录结果、失败案例、适用边界和下一轮单变量改进。

自测与答案

第 1 题

评估“Flash Attention”时,第一步最应该做什么?

尚未检查本题。

查看答案与评价要点

参考答案:先定位Flash Attention要解决的瓶颈,并定义可测成功指标

解析:Flash Attention只有针对真实瓶颈并用明确指标验证,结论才有意义。

第 2 题

为什么不能看到“Flash Attention”就断言系统一定更快或更好?

尚未检查本题。

查看答案与评价要点

参考答案:因为Flash Attention的收益依赖工作负载、实现和测量条件,还可能引入额外代价

解析:它没有把注意力理论计算量从平方级变成线性级;收益依赖序列长度、硬件、数据类型和内核支持。短序列上启动开销可能盖过收益。

第 3 题

验证“Flash Attention”的最小实验应包含哪些要素?(多选)

尚未检查本题。

查看答案与评价要点

参考答案:为Flash Attention建立未改动基线或对照组;验证Flash Attention时每轮固定其他变量;同时记录Flash Attention的质量、延迟和资源指标

解析:在三种序列长度上比较普通 SDPA 与 Flash 后端的时间和峰值显存。

尚未完成自测。

今日完成标准

  • 提交机制图或数据流图。
  • 提交可复现实验记录与原始指标。
  • 写出至少一个失败案例和适用边界。

常见错误与纠正提示

  • 只记住“Flash Attention”这个名词,没有说明它实际减少或增加了什么成本。
  • 只报告平均值,不记录输入规模、尾延迟、质量或资源峰值。
  • 把特定实现的结果外推为所有模型、硬件和业务都成立。

分层任务

基础任务

画一张Flash Attention概念图并解释五个关键词。

标准任务

在三种序列长度上比较普通 SDPA 与 Flash 后端的时间和峰值显存。

挑战任务

为Flash Attention设计一个包含对照组、异常注入和回退条件的评估方案。

关联知识点

延伸阅读

学习状态:未学习

Day 121

GQA/MQA/MLA

建议时长:60 分钟

本日 CO:CO3 CO8

本日概要

先说人话:MHA 每个查询头都有独立 K/V;MQA 让所有查询头共享一组 K/V;GQA 让若干查询头共享一组;MLA 用低秩潜变量压缩并重构注意力所需信息。MHA 每个查询头都有独立 K/V;MQA 让所有查询头共享一组 K/V;GQA 让若干查询头共享一组;MLA 用低秩潜变量压缩并重构注意力所需信息。目标都是减少 KV Cache 和读取带宽。共享越强越省缓存,但质量与兼容性取决于训练方式,不能只在部署时随意把已有 MHA 权重改成 MQA。MLA 的具体实现也不能简单等同于更多共享头。学习GQA/MQA/MLA时,要把机制图、对照实验和失败案例放在一起:先证明瓶颈存在,再证明改动确实改善目标指标,最后确认没有把代价转移到质量、安全或其他资源。

听书与视频

本日听书

5 分钟 · MP3 · 双主持人讲解

B 站讲解

[LLM 原理] MQA、GQA、DeepSeek MLA 是什么?——KVCache 相关技术解析

我是小小升 · 已核验 2026-08-31

在 B 站打开

学习目标

  • 能用自己的话解释GQA/MQA/MLA的工作机制
  • 能识别GQA/MQA/MLA的适用条件与失败边界
  • 能设计带指标和对照组的验证实验

核心讲解

先说人话

先说人话:MHA 每个查询头都有独立 K/V;MQA 让所有查询头共享一组 K/V;GQA 让若干查询头共享一组;MLA 用低秩潜变量压缩并重构注意力所需信息。

学习GQA/MQA/MLA先明确它解决的瓶颈,再判断是否值得引入;名称相似不代表机制相同。

机制拆开

MHA 每个查询头都有独立 K/V;MQA 让所有查询头共享一组 K/V;GQA 让若干查询头共享一组;MLA 用低秩潜变量压缩并重构注意力所需信息。目标都是减少 KV Cache 和读取带宽。

分析GQA/MQA/MLA时沿输入、状态、计算或检索、输出四步画数据流,并把成本落到时间、显存、带宽或质量指标。

边界与取舍

共享越强越省缓存,但质量与兼容性取决于训练方式,不能只在部署时随意把已有 MHA 权重改成 MQA。MLA 的具体实现也不能简单等同于更多共享头。

评价GQA/MQA/MLA必须附工作负载、硬件或模型、版本和测量口径;没有这些条件的“更快”“更准”不能直接用于选型。

落地检查

把GQA/MQA/MLA放进真实系统前,先保存未改动方案的原始数据,再按单一变量引入改动。评估GQA/MQA/MLA不能只看平均值,还要记录尾延迟、资源峰值、异常输入和失败恢复。

复盘GQA/MQA/MLA实验时,要能回答三个问题:改善来自哪一步,代价转移到了哪里,指标不达标时如何停止并回滚。这样得到的GQA/MQA/MLA结论不是一张漂亮截图,而是一份别人可以复核的工程证据。最后还要把GQA/MQA/MLA的配置、版本、样本和原始输出一起保存,确保换一个人也能重复同样的检查。

上线前再为GQA/MQA/MLA安排一次反向评审:让没有参与实现的人只看记录复现实验,并主动寻找会推翻结论的输入。如果GQA/MQA/MLA复现失败,就先补证据而不是扩大部署范围。

实践任务

给定头数与维度,计算 MHA、GQA、MQA 的 KV 容量并说明质量风险。

  • 写出问题定义、输入输出与成功指标。
  • 画出数据流并标出主要状态、计算和外部依赖。
  • 给定头数与维度,计算 MHA、GQA、MQA 的 KV 容量并说明质量风险。
  • 记录结果、失败案例、适用边界和下一轮单变量改进。

自测与答案

第 1 题

评估“GQA/MQA/MLA”时,第一步最应该做什么?

尚未检查本题。

查看答案与评价要点

参考答案:先定位GQA/MQA/MLA要解决的瓶颈,并定义可测成功指标

解析:GQA/MQA/MLA只有针对真实瓶颈并用明确指标验证,结论才有意义。

第 2 题

为什么不能看到“GQA/MQA/MLA”就断言系统一定更快或更好?

尚未检查本题。

查看答案与评价要点

参考答案:因为GQA/MQA/MLA的收益依赖工作负载、实现和测量条件,还可能引入额外代价

解析:共享越强越省缓存,但质量与兼容性取决于训练方式,不能只在部署时随意把已有 MHA 权重改成 MQA。MLA 的具体实现也不能简单等同于更多共享头。

第 3 题

验证“GQA/MQA/MLA”的最小实验应包含哪些要素?(多选)

尚未检查本题。

查看答案与评价要点

参考答案:为GQA/MQA/MLA建立未改动基线或对照组;验证GQA/MQA/MLA时每轮固定其他变量;同时记录GQA/MQA/MLA的质量、延迟和资源指标

解析:给定头数与维度,计算 MHA、GQA、MQA 的 KV 容量并说明质量风险。

尚未完成自测。

今日完成标准

  • 提交机制图或数据流图。
  • 提交可复现实验记录与原始指标。
  • 写出至少一个失败案例和适用边界。

常见错误与纠正提示

  • 只记住“GQA/MQA/MLA”这个名词,没有说明它实际减少或增加了什么成本。
  • 只报告平均值,不记录输入规模、尾延迟、质量或资源峰值。
  • 把特定实现的结果外推为所有模型、硬件和业务都成立。

分层任务

基础任务

画一张GQA/MQA/MLA概念图并解释五个关键词。

标准任务

给定头数与维度,计算 MHA、GQA、MQA 的 KV 容量并说明质量风险。

挑战任务

为GQA/MQA/MLA设计一个包含对照组、异常注入和回退条件的评估方案。

关联知识点

延伸阅读

学习状态:未学习

Day 122

稀疏注意力

建议时长:60 分钟

本日 CO:CO3 CO8

本日概要

先说人话:全注意力让每个 Token 看全部位置。全注意力让每个 Token 看全部位置。稀疏注意力只保留局部窗口、固定全局点或内容选择的连接,用更少计算支持更长序列。稀疏模式会改变信息可达路径;关键信息若不在连接图里,长度再长也看不到。理论稀疏还需要硬件友好的内核才能转成真实加速。学习稀疏注意力时,要把机制图、对照实验和失败案例放在一起:先证明瓶颈存在,再证明改动确实改善目标指标,最后确认没有把代价转移到质量、安全或其他资源。

听书与视频

本日听书

4 分钟 · MP3 · 双主持人讲解

B 站讲解

【10】Sparse Attention & Infini Attention 稀疏注意力和无限注意力

LLM张老师 · 已核验 2026-08-31

在 B 站打开

学习目标

  • 能用自己的话解释稀疏注意力的工作机制
  • 能识别稀疏注意力的适用条件与失败边界
  • 能设计带指标和对照组的验证实验

核心讲解

先说人话

先说人话:全注意力让每个 Token 看全部位置。

学习稀疏注意力先明确它解决的瓶颈,再判断是否值得引入;名称相似不代表机制相同。

机制拆开

全注意力让每个 Token 看全部位置。稀疏注意力只保留局部窗口、固定全局点或内容选择的连接,用更少计算支持更长序列。

分析稀疏注意力时沿输入、状态、计算或检索、输出四步画数据流,并把成本落到时间、显存、带宽或质量指标。

边界与取舍

稀疏模式会改变信息可达路径;关键信息若不在连接图里,长度再长也看不到。理论稀疏还需要硬件友好的内核才能转成真实加速。

评价稀疏注意力必须附工作负载、硬件或模型、版本和测量口径;没有这些条件的“更快”“更准”不能直接用于选型。

落地检查

把稀疏注意力放进真实系统前,先保存未改动方案的原始数据,再按单一变量引入改动。评估稀疏注意力不能只看平均值,还要记录尾延迟、资源峰值、异常输入和失败恢复。

复盘稀疏注意力实验时,要能回答三个问题:改善来自哪一步,代价转移到了哪里,指标不达标时如何停止并回滚。这样得到的稀疏注意力结论不是一张漂亮截图,而是一份别人可以复核的工程证据。最后还要把稀疏注意力的配置、版本、样本和原始输出一起保存,确保换一个人也能重复同样的检查。

上线前再为稀疏注意力安排一次反向评审:让没有参与实现的人只看记录复现实验,并主动寻找会推翻结论的输入。如果稀疏注意力复现失败,就先补证据而不是扩大部署范围。

实践任务

为长文档设计滑窗加全局 Token 的连接图,并构造跨窗依赖反例。

  • 写出问题定义、输入输出与成功指标。
  • 画出数据流并标出主要状态、计算和外部依赖。
  • 为长文档设计滑窗加全局 Token 的连接图,并构造跨窗依赖反例。
  • 记录结果、失败案例、适用边界和下一轮单变量改进。

自测与答案

第 1 题

评估“稀疏注意力”时,第一步最应该做什么?

尚未检查本题。

查看答案与评价要点

参考答案:先定位稀疏注意力要解决的瓶颈,并定义可测成功指标

解析:稀疏注意力只有针对真实瓶颈并用明确指标验证,结论才有意义。

第 2 题

为什么不能看到“稀疏注意力”就断言系统一定更快或更好?

尚未检查本题。

查看答案与评价要点

参考答案:因为稀疏注意力的收益依赖工作负载、实现和测量条件,还可能引入额外代价

解析:稀疏模式会改变信息可达路径;关键信息若不在连接图里,长度再长也看不到。理论稀疏还需要硬件友好的内核才能转成真实加速。

第 3 题

验证“稀疏注意力”的最小实验应包含哪些要素?(多选)

尚未检查本题。

查看答案与评价要点

参考答案:为稀疏注意力建立未改动基线或对照组;验证稀疏注意力时每轮固定其他变量;同时记录稀疏注意力的质量、延迟和资源指标

解析:为长文档设计滑窗加全局 Token 的连接图,并构造跨窗依赖反例。

尚未完成自测。

今日完成标准

  • 提交机制图或数据流图。
  • 提交可复现实验记录与原始指标。
  • 写出至少一个失败案例和适用边界。

常见错误与纠正提示

  • 只记住“稀疏注意力”这个名词,没有说明它实际减少或增加了什么成本。
  • 只报告平均值,不记录输入规模、尾延迟、质量或资源峰值。
  • 把特定实现的结果外推为所有模型、硬件和业务都成立。

分层任务

基础任务

画一张稀疏注意力概念图并解释五个关键词。

标准任务

为长文档设计滑窗加全局 Token 的连接图,并构造跨窗依赖反例。

挑战任务

为稀疏注意力设计一个包含对照组、异常注入和回退条件的评估方案。

关联知识点

延伸阅读

学习状态:未学习

Day 123

模型路由

建议时长:60 分钟

本日 CO:CO3 CO8

本日概要

先说人话:路由有两层含义:MoE 在一个模型内部按 Token 选择专家;多模型路由在请求层选择不同模型或工具。路由有两层含义:MoE 在一个模型内部按 Token 选择专家;多模型路由在请求层选择不同模型或工具。前者平衡专家容量,后者按质量、成本、时延和权限分流。路由器会犯错,也会造成热门专家或模型过载。必须保留回退、容量因子、质量评估和可观察性,不能只用关键词硬分。学习模型路由时,要把机制图、对照实验和失败案例放在一起:先证明瓶颈存在,再证明改动确实改善目标指标,最后确认没有把代价转移到质量、安全或其他资源。

听书与视频

本日听书

4 分钟 · MP3 · 双主持人讲解

B 站讲解

大模型路由项目clawrouter

Token杰-自然智群 · 已核验 2026-08-31

在 B 站打开

学习目标

  • 能用自己的话解释模型路由的工作机制
  • 能识别模型路由的适用条件与失败边界
  • 能设计带指标和对照组的验证实验

核心讲解

先说人话

先说人话:路由有两层含义:MoE 在一个模型内部按 Token 选择专家;多模型路由在请求层选择不同模型或工具。

学习模型路由先明确它解决的瓶颈,再判断是否值得引入;名称相似不代表机制相同。

机制拆开

路由有两层含义:MoE 在一个模型内部按 Token 选择专家;多模型路由在请求层选择不同模型或工具。前者平衡专家容量,后者按质量、成本、时延和权限分流。

分析模型路由时沿输入、状态、计算或检索、输出四步画数据流,并把成本落到时间、显存、带宽或质量指标。

边界与取舍

路由器会犯错,也会造成热门专家或模型过载。必须保留回退、容量因子、质量评估和可观察性,不能只用关键词硬分。

评价模型路由必须附工作负载、硬件或模型、版本和测量口径;没有这些条件的“更快”“更准”不能直接用于选型。

落地检查

把模型路由放进真实系统前,先保存未改动方案的原始数据,再按单一变量引入改动。评估模型路由不能只看平均值,还要记录尾延迟、资源峰值、异常输入和失败恢复。

复盘模型路由实验时,要能回答三个问题:改善来自哪一步,代价转移到了哪里,指标不达标时如何停止并回滚。这样得到的模型路由结论不是一张漂亮截图,而是一份别人可以复核的工程证据。最后还要把模型路由的配置、版本、样本和原始输出一起保存,确保换一个人也能重复同样的检查。

上线前再为模型路由安排一次反向评审:让没有参与实现的人只看记录复现实验,并主动寻找会推翻结论的输入。如果模型路由复现失败,就先补证据而不是扩大部署范围。

实践任务

制作一个五类请求集,比较规则路由与学习路由的准确率、成本和回退率。

  • 写出问题定义、输入输出与成功指标。
  • 画出数据流并标出主要状态、计算和外部依赖。
  • 制作一个五类请求集,比较规则路由与学习路由的准确率、成本和回退率。
  • 记录结果、失败案例、适用边界和下一轮单变量改进。

自测与答案

第 1 题

评估“模型路由”时,第一步最应该做什么?

尚未检查本题。

查看答案与评价要点

参考答案:先定位模型路由要解决的瓶颈,并定义可测成功指标

解析:模型路由只有针对真实瓶颈并用明确指标验证,结论才有意义。

第 2 题

为什么不能看到“模型路由”就断言系统一定更快或更好?

尚未检查本题。

查看答案与评价要点

参考答案:因为模型路由的收益依赖工作负载、实现和测量条件,还可能引入额外代价

解析:路由器会犯错,也会造成热门专家或模型过载。必须保留回退、容量因子、质量评估和可观察性,不能只用关键词硬分。

第 3 题

验证“模型路由”的最小实验应包含哪些要素?(多选)

尚未检查本题。

查看答案与评价要点

参考答案:为模型路由建立未改动基线或对照组;验证模型路由时每轮固定其他变量;同时记录模型路由的质量、延迟和资源指标

解析:制作一个五类请求集,比较规则路由与学习路由的准确率、成本和回退率。

尚未完成自测。

今日完成标准

  • 提交机制图或数据流图。
  • 提交可复现实验记录与原始指标。
  • 写出至少一个失败案例和适用边界。

常见错误与纠正提示

  • 只记住“模型路由”这个名词,没有说明它实际减少或增加了什么成本。
  • 只报告平均值,不记录输入规模、尾延迟、质量或资源峰值。
  • 把特定实现的结果外推为所有模型、硬件和业务都成立。

分层任务

基础任务

画一张模型路由概念图并解释五个关键词。

标准任务

制作一个五类请求集,比较规则路由与学习路由的准确率、成本和回退率。

挑战任务

为模型路由设计一个包含对照组、异常注入和回退条件的评估方案。

关联知识点

延伸阅读

学习状态:未学习

Day 124

推理时扩展

建议时长:60 分钟

本日 CO:CO3 CO8

本日概要

先说人话:训练结束后仍可在回答时投入更多计算:多次采样、搜索候选、调用验证器或延长推理轨迹,再选择更可靠结果。训练结束后仍可在回答时投入更多计算:多次采样、搜索候选、调用验证器或延长推理轨迹,再选择更可靠结果。这叫把预算从训练期移到推理期。更多计算存在收益递减,验证器也可能偏置或被欺骗。简单任务盲目增加采样只会增加成本和延迟,应按难度动态分配预算。学习推理时扩展时,要把机制图、对照实验和失败案例放在一起:先证明瓶颈存在,再证明改动确实改善目标指标,最后确认没有把代价转移到质量、安全或其他资源。

听书与视频

本日听书

5 分钟 · MP3 · 双主持人讲解

B 站讲解

扩展测试时计算的关键要素 The Key Ingredients for Scaling Test-Time Compute

北美教职圈频道 · 已核验 2026-08-31

在 B 站打开

学习目标

  • 能用自己的话解释推理时扩展的工作机制
  • 能识别推理时扩展的适用条件与失败边界
  • 能设计带指标和对照组的验证实验

核心讲解

先说人话

先说人话:训练结束后仍可在回答时投入更多计算:多次采样、搜索候选、调用验证器或延长推理轨迹,再选择更可靠结果。

学习推理时扩展先明确它解决的瓶颈,再判断是否值得引入;名称相似不代表机制相同。

机制拆开

训练结束后仍可在回答时投入更多计算:多次采样、搜索候选、调用验证器或延长推理轨迹,再选择更可靠结果。这叫把预算从训练期移到推理期。

分析推理时扩展时沿输入、状态、计算或检索、输出四步画数据流,并把成本落到时间、显存、带宽或质量指标。

边界与取舍

更多计算存在收益递减,验证器也可能偏置或被欺骗。简单任务盲目增加采样只会增加成本和延迟,应按难度动态分配预算。

评价推理时扩展必须附工作负载、硬件或模型、版本和测量口径;没有这些条件的“更快”“更准”不能直接用于选型。

落地检查

把推理时扩展放进真实系统前,先保存未改动方案的原始数据,再按单一变量引入改动。评估推理时扩展不能只看平均值,还要记录尾延迟、资源峰值、异常输入和失败恢复。

复盘推理时扩展实验时,要能回答三个问题:改善来自哪一步,代价转移到了哪里,指标不达标时如何停止并回滚。这样得到的推理时扩展结论不是一张漂亮截图,而是一份别人可以复核的工程证据。最后还要把推理时扩展的配置、版本、样本和原始输出一起保存,确保换一个人也能重复同样的检查。

上线前再为推理时扩展安排一次反向评审:让没有参与实现的人只看记录复现实验,并主动寻找会推翻结论的输入。如果推理时扩展复现失败,就先补证据而不是扩大部署范围。

实践任务

在一组可自动判分任务上绘制采样次数与正确率、成本、延迟的曲线。

  • 写出问题定义、输入输出与成功指标。
  • 画出数据流并标出主要状态、计算和外部依赖。
  • 在一组可自动判分任务上绘制采样次数与正确率、成本、延迟的曲线。
  • 记录结果、失败案例、适用边界和下一轮单变量改进。

自测与答案

第 1 题

评估“推理时扩展”时,第一步最应该做什么?

尚未检查本题。

查看答案与评价要点

参考答案:先定位推理时扩展要解决的瓶颈,并定义可测成功指标

解析:推理时扩展只有针对真实瓶颈并用明确指标验证,结论才有意义。

第 2 题

为什么不能看到“推理时扩展”就断言系统一定更快或更好?

尚未检查本题。

查看答案与评价要点

参考答案:因为推理时扩展的收益依赖工作负载、实现和测量条件,还可能引入额外代价

解析:更多计算存在收益递减,验证器也可能偏置或被欺骗。简单任务盲目增加采样只会增加成本和延迟,应按难度动态分配预算。

第 3 题

验证“推理时扩展”的最小实验应包含哪些要素?(多选)

尚未检查本题。

查看答案与评价要点

参考答案:为推理时扩展建立未改动基线或对照组;验证推理时扩展时每轮固定其他变量;同时记录推理时扩展的质量、延迟和资源指标

解析:在一组可自动判分任务上绘制采样次数与正确率、成本、延迟的曲线。

尚未完成自测。

今日完成标准

  • 提交机制图或数据流图。
  • 提交可复现实验记录与原始指标。
  • 写出至少一个失败案例和适用边界。

常见错误与纠正提示

  • 只记住“推理时扩展”这个名词,没有说明它实际减少或增加了什么成本。
  • 只报告平均值,不记录输入规模、尾延迟、质量或资源峰值。
  • 把特定实现的结果外推为所有模型、硬件和业务都成立。

分层任务

基础任务

画一张推理时扩展概念图并解释五个关键词。

标准任务

在一组可自动判分任务上绘制采样次数与正确率、成本、延迟的曲线。

挑战任务

为推理时扩展设计一个包含对照组、异常注入和回退条件的评估方案。

关联知识点

延伸阅读

学习状态:未学习

Day 125

Tokenizer 与特殊 Token

建议时长:60 分钟

本日 CO:CO3 CO8

本日概要

先说人话:Tokenizer 把文本变成模型认识的整数序列。Tokenizer 把文本变成模型认识的整数序列。词表、归一化、预分词和合并规则决定同一文本如何切分;BOS、EOS、PAD 与对话边界等特殊 Token 还承担控制协议。字符数不等于 Token 数,中英文和代码差异很大。新增特殊 Token 后若不调整模型嵌入或聊天模板,可能出现越界、误终止或角色串线。学习Tokenizer 与特殊 Token时,要把机制图、对照实验和失败案例放在一起:先证明瓶颈存在,再证明改动确实改善目标指标,最后确认没有把代价转移到质量、安全或其他资源。

听书与视频

本日听书

5 分钟 · MP3 · 双主持人讲解

B 站讲解

分词器 (Tokenizer)原理简介和代码实现

AI技术应用实践 · 已核验 2026-08-31

在 B 站打开

学习目标

  • 能用自己的话解释Tokenizer 与特殊 Token的工作机制
  • 能识别Tokenizer 与特殊 Token的适用条件与失败边界
  • 能设计带指标和对照组的验证实验

核心讲解

先说人话

先说人话:Tokenizer 把文本变成模型认识的整数序列。

学习Tokenizer 与特殊 Token先明确它解决的瓶颈,再判断是否值得引入;名称相似不代表机制相同。

机制拆开

Tokenizer 把文本变成模型认识的整数序列。词表、归一化、预分词和合并规则决定同一文本如何切分;BOS、EOS、PAD 与对话边界等特殊 Token 还承担控制协议。

分析Tokenizer 与特殊 Token时沿输入、状态、计算或检索、输出四步画数据流,并把成本落到时间、显存、带宽或质量指标。

边界与取舍

字符数不等于 Token 数,中英文和代码差异很大。新增特殊 Token 后若不调整模型嵌入或聊天模板,可能出现越界、误终止或角色串线。

评价Tokenizer 与特殊 Token必须附工作负载、硬件或模型、版本和测量口径;没有这些条件的“更快”“更准”不能直接用于选型。

落地检查

把Tokenizer 与特殊 Token放进真实系统前,先保存未改动方案的原始数据,再按单一变量引入改动。评估Tokenizer 与特殊 Token不能只看平均值,还要记录尾延迟、资源峰值、异常输入和失败恢复。

复盘Tokenizer 与特殊 Token实验时,要能回答三个问题:改善来自哪一步,代价转移到了哪里,指标不达标时如何停止并回滚。这样得到的Tokenizer 与特殊 Token结论不是一张漂亮截图,而是一份别人可以复核的工程证据。最后还要把Tokenizer 与特殊 Token的配置、版本、样本和原始输出一起保存,确保换一个人也能重复同样的检查。

上线前再为Tokenizer 与特殊 Token安排一次反向评审:让没有参与实现的人只看记录复现实验,并主动寻找会推翻结论的输入。如果Tokenizer 与特殊 Token复现失败,就先补证据而不是扩大部署范围。

实践任务

比较中英文、代码和表格的 Token 数,并验证 BOS/EOS/PAD 在模板中的位置。

  • 写出问题定义、输入输出与成功指标。
  • 画出数据流并标出主要状态、计算和外部依赖。
  • 比较中英文、代码和表格的 Token 数,并验证 BOS/EOS/PAD 在模板中的位置。
  • 记录结果、失败案例、适用边界和下一轮单变量改进。

自测与答案

第 1 题

评估“Tokenizer 与特殊 Token”时,第一步最应该做什么?

尚未检查本题。

查看答案与评价要点

参考答案:先定位Tokenizer 与特殊 Token要解决的瓶颈,并定义可测成功指标

解析:Tokenizer 与特殊 Token只有针对真实瓶颈并用明确指标验证,结论才有意义。

第 2 题

为什么不能看到“Tokenizer 与特殊 Token”就断言系统一定更快或更好?

尚未检查本题。

查看答案与评价要点

参考答案:因为Tokenizer 与特殊 Token的收益依赖工作负载、实现和测量条件,还可能引入额外代价

解析:字符数不等于 Token 数,中英文和代码差异很大。新增特殊 Token 后若不调整模型嵌入或聊天模板,可能出现越界、误终止或角色串线。

第 3 题

验证“Tokenizer 与特殊 Token”的最小实验应包含哪些要素?(多选)

尚未检查本题。

查看答案与评价要点

参考答案:为Tokenizer 与特殊 Token建立未改动基线或对照组;验证Tokenizer 与特殊 Token时每轮固定其他变量;同时记录Tokenizer 与特殊 Token的质量、延迟和资源指标

解析:比较中英文、代码和表格的 Token 数,并验证 BOS/EOS/PAD 在模板中的位置。

尚未完成自测。

今日完成标准

  • 提交机制图或数据流图。
  • 提交可复现实验记录与原始指标。
  • 写出至少一个失败案例和适用边界。

常见错误与纠正提示

  • 只记住“Tokenizer 与特殊 Token”这个名词,没有说明它实际减少或增加了什么成本。
  • 只报告平均值,不记录输入规模、尾延迟、质量或资源峰值。
  • 把特定实现的结果外推为所有模型、硬件和业务都成立。

分层任务

基础任务

画一张Tokenizer 与特殊 Token概念图并解释五个关键词。

标准任务

比较中英文、代码和表格的 Token 数,并验证 BOS/EOS/PAD 在模板中的位置。

挑战任务

为Tokenizer 与特殊 Token设计一个包含对照组、异常注入和回退条件的评估方案。

关联知识点

延伸阅读

学习状态:未学习

Day 126

模型蒸馏

建议时长:60 分钟

本日 CO:CO3 CO8

本日概要

先说人话:蒸馏让学生模型学习教师的软分布、隐藏表示或教师生成的数据,而不只是硬标签。蒸馏让学生模型学习教师的软分布、隐藏表示或教师生成的数据,而不只是硬标签。软目标能暴露类别之间的相似关系,常用于压缩成本与延迟。学生容量决定可吸收的信息上限;教师错误也会被继承。只在教师生成数据上评估会形成闭环自证,必须保留独立真实测试集。学习模型蒸馏时,要把机制图、对照实验和失败案例放在一起:先证明瓶颈存在,再证明改动确实改善目标指标,最后确认没有把代价转移到质量、安全或其他资源。

听书与视频

本日听书

4 分钟 · MP3 · 双主持人讲解

B 站讲解

[知识蒸馏][01] 耗时两天半,完全从零开始实现大模型知识蒸馏(Qwen2.5系列模型),从原理讲解、代码实现到效果测试,绝对让你搞懂模型蒸馏

偷星九月333 · 已核验 2026-08-31

在 B 站打开

学习目标

  • 能用自己的话解释模型蒸馏的工作机制
  • 能识别模型蒸馏的适用条件与失败边界
  • 能设计带指标和对照组的验证实验

核心讲解

先说人话

先说人话:蒸馏让学生模型学习教师的软分布、隐藏表示或教师生成的数据,而不只是硬标签。

学习模型蒸馏先明确它解决的瓶颈,再判断是否值得引入;名称相似不代表机制相同。

机制拆开

蒸馏让学生模型学习教师的软分布、隐藏表示或教师生成的数据,而不只是硬标签。软目标能暴露类别之间的相似关系,常用于压缩成本与延迟。

分析模型蒸馏时沿输入、状态、计算或检索、输出四步画数据流,并把成本落到时间、显存、带宽或质量指标。

边界与取舍

学生容量决定可吸收的信息上限;教师错误也会被继承。只在教师生成数据上评估会形成闭环自证,必须保留独立真实测试集。

评价模型蒸馏必须附工作负载、硬件或模型、版本和测量口径;没有这些条件的“更快”“更准”不能直接用于选型。

落地检查

把模型蒸馏放进真实系统前,先保存未改动方案的原始数据,再按单一变量引入改动。评估模型蒸馏不能只看平均值,还要记录尾延迟、资源峰值、异常输入和失败恢复。

复盘模型蒸馏实验时,要能回答三个问题:改善来自哪一步,代价转移到了哪里,指标不达标时如何停止并回滚。这样得到的模型蒸馏结论不是一张漂亮截图,而是一份别人可以复核的工程证据。最后还要把模型蒸馏的配置、版本、样本和原始输出一起保存,确保换一个人也能重复同样的检查。

上线前再为模型蒸馏安排一次反向评审:让没有参与实现的人只看记录复现实验,并主动寻找会推翻结论的输入。如果模型蒸馏复现失败,就先补证据而不是扩大部署范围。

实践任务

训练一个小学生模型,对比硬标签、软目标和混合损失,并做独立误差分析。

  • 写出问题定义、输入输出与成功指标。
  • 画出数据流并标出主要状态、计算和外部依赖。
  • 训练一个小学生模型,对比硬标签、软目标和混合损失,并做独立误差分析。
  • 记录结果、失败案例、适用边界和下一轮单变量改进。

自测与答案

第 1 题

评估“模型蒸馏”时,第一步最应该做什么?

尚未检查本题。

查看答案与评价要点

参考答案:先定位模型蒸馏要解决的瓶颈,并定义可测成功指标

解析:模型蒸馏只有针对真实瓶颈并用明确指标验证,结论才有意义。

第 2 题

为什么不能看到“模型蒸馏”就断言系统一定更快或更好?

尚未检查本题。

查看答案与评价要点

参考答案:因为模型蒸馏的收益依赖工作负载、实现和测量条件,还可能引入额外代价

解析:学生容量决定可吸收的信息上限;教师错误也会被继承。只在教师生成数据上评估会形成闭环自证,必须保留独立真实测试集。

第 3 题

验证“模型蒸馏”的最小实验应包含哪些要素?(多选)

尚未检查本题。

查看答案与评价要点

参考答案:为模型蒸馏建立未改动基线或对照组;验证模型蒸馏时每轮固定其他变量;同时记录模型蒸馏的质量、延迟和资源指标

解析:训练一个小学生模型,对比硬标签、软目标和混合损失,并做独立误差分析。

尚未完成自测。

今日完成标准

  • 提交机制图或数据流图。
  • 提交可复现实验记录与原始指标。
  • 写出至少一个失败案例和适用边界。

常见错误与纠正提示

  • 只记住“模型蒸馏”这个名词,没有说明它实际减少或增加了什么成本。
  • 只报告平均值,不记录输入规模、尾延迟、质量或资源峰值。
  • 把特定实现的结果外推为所有模型、硬件和业务都成立。

分层任务

基础任务

画一张模型蒸馏概念图并解释五个关键词。

标准任务

训练一个小学生模型,对比硬标签、软目标和混合损失,并做独立误差分析。

挑战任务

为模型蒸馏设计一个包含对照组、异常注入和回退条件的评估方案。

关联知识点

延伸阅读

学习状态:未学习