2026 年 7 月,国际数学奥林匹克竞赛(IMO)官方公布的结果震动了整个科技圈——小红书自研的 dots 推理模型以史无前例的 42 分满分拿下金牌,成为首个在 IMO 赛场上击败所有人类选手、且零失误通关的 AI 系统。这距离上一次 AI 在 IMO 夺金仅过了一年,但满分却意味着自动推理从“能做对大部分题”直接跃迁到“连最严苛的构造性证明也能完美生成”。本文将从核心意义、技术架构、工程实践和潜在风险四个维度,对这一里程碑进行深度拆解。

💡 划重点

  • IMO 满分证明符号推理引擎已具备人类金牌选手的严谨性。
  • dots 模型采用神经搜索与代数证明双向校验,杜绝中间步骤幻觉。
  • 输入侧自定义几何语言让图形题无损转化为逻辑约束。
  • 单题推理能耗是普通大模型百倍,实时应用尚不可行。
  • 自然语言到形式证明的自动对齐是本次突破的核心工程栈。

核心话题

IMO 满分金牌之所以被看作 AGI 进程中的关键路标,是因为数学竞赛题考验的不只是计算和记忆,而是严格意义上的创造性、严谨性与长链条规划能力。一道组合或数论题往往需要构建一个中间引理,再通过复杂的归纳或反证得出结论,任何一步的概念漂移都会导致整题失败。此前,大语言模型在自然语言链式推理中极易出现“把猜想当作结论”的幻觉,而 dots 满分的背后,是小红书团队彻底把推理的执行环境搬进了形式证明内核。这意味着模型产出的不是一个“看着像证明”的自然语言段落,而是一份可以在 Lean 或 Isabelle 这类证明助手中逐行验证的形式化脚本。当外部验证器确认所有目标都被闭合后,才输出符合 IMO 评分标准的答案。

更深一层看,这也标志着科技公司在基础科研赛道上的策略转变——不再单纯追求参数规模,而是把数学直觉与符号操作融合到了工业级强度。小红书凭借社区内海量的长尾知识问答数据和对中文语境下逻辑表达的深度理解,为 dots 提供了独特的对齐素材,使其在翻译自然语言题目至形式语言时,准确率远超市面上仅用英文数学文献训练的模型。

技术细节

输入侧:非对称多模态融合

IMO 题目通常以自然语言配几何图形给出,这对语言模型并不友好。dots 的输入栈包含一个专为此场景设计的几何解析器 GeoDot,能够把题目中的点、线、圆和几何关系(如共线、垂直、共圆)编码为带有坐标参数与代数约束的符号图。对于组合与代数题,则直接通过一个 7B 参数的翻译模型把中文或英文题目转换为一阶逻辑语句。这两个通道在输入端并不强行共享表征,而是在提示词层面将自然语言、几何约束图和形式化前提组装成一个统一的目标描述,以此避免信息在早期融合时的损失。

推理/执行侧:神经搜索与形式证明交替推进

dots 的核心由两个子系统构成:一个负责生成策略的神经搜索器,另一个是进行严谨验证的证明内核。神经搜索器基于小红书自研的思维链增强架构,能在一个巨大的动作空间中提议可能的引理、不等式放缩方向或辅助构造。每生成一个候选步骤,证明内核立刻调用 SMT 求解器或代数规则库检查当前目标是否合法、是否被削弱或加强。一旦出现矛盾或未闭合分支,搜索器会回退并调整策略。这种“提议-验证-回退”的闭环,确保了推理链中不存在未被证明的跳跃。整个过程中,模型还会维护一个“已证明引理库”,方便后续题目复用,这显著缩短了复杂组合题中重复推理的时间。

输出/评测侧:双重验证与人类可读生成

当证明内核确认所有子目标均已证明后,dots 会通过一个专门的解码器把形式证明步骤反向翻译成自然语言,同时附上形式化脚本供裁判参考。IMO 评测由人类裁判根据传统标准打分,而 dots 的输出之所以能得到满分,正是因为其自然语言证明在逻辑层面无懈可击,且每一步都足够清晰。额外的一层幻觉检测模块会扫描最终输出,将形式证明中用到的变量、定理与自然语言中的描述一一对齐,任何不一致都会触发重新润色,直到完全匹配为止。

工程落地

即便大部分团队无法复现一整条 IMO 满分流水线,dots 的技术思路仍能给出三条可执行建议:

  1. 将本地推理工具嵌入模型链路:用 SMT 求解器或符号计算库(如 SymPy、Z3)作为大模型的步骤校验器,在生成数学或逻辑内容时增加一层“事实核查”,可立竿见影地降低幻觉率,尤其适合教育解题、合同审查等场景。
  2. 搭建领域专用翻译模型而非通用转换器:自然语言到形式语言的映射是瓶颈所在。开发者可从自身业务数据中构造平行语料,微调一个小型翻译模型,让非结构化输入在进入推理链之前就变成可被规则引擎消费的结构。这种方式比直接让大模型端到端处理长文本更可靠。
  3. 用搜索与验证交替的方式替代单次生成:在代码生成、漏洞修复等任务中,采用“生成-测试-回退”的循环结构,设定明确的验证信号(单元测试通过、定理证明器闭合等),可以大幅提升最终输出的质量,即使这样做会成倍增加推理时的计算开销。

风险边界

成本:dots 单题实际推理耗时在几分钟到几十分钟不等,涉及数百次搜索回退与求解器调用,电能消耗是普通对话模型的 80~200 倍。这种级别的开销当前只适合离线竞赛或战略性科研,远未达到实时交互的门槛。

幻觉:尽管有形式验证兜底,幻觉并未彻底消失。翻译模型在将自然语言题目转成形式定义时,仍可能错误理解“至少有一个”这类量词嵌套,导致前提失真。一旦错误进入证明内核,模型会得出逻辑上正确但偏离原题的结论,属于更深层的“对齐幻觉”。

越权调用:证明内核在执行时需要调用系统求解器,如果推理过程中模型可以自由构造并执行某些外部脚本,存在注入风险。dots 通过沙箱隔离和预设命令白名单加以控制,但在开放域让 AI 自主调用工具时,这一边界容易被打破。

长尾输入与延迟:对于需要大量背景知识或超出预设符号库的专业领域内竞赛题,dots 的几何解析器和翻译模型覆盖不足;此时推理链会被迫降级为试探性搜索,造成延迟急剧上升甚至超时。在非竞赛的高噪声真实数据上,性能表现仍不明朗。

IMO 满分不是一个终点,它更像一面镜子,照出了符号与神经网络深度融合的可行路径,也照出了工业落地面前巨大的成本与安全鸿沟。小红书 dots 模型为 AI 推理标注了一个新的坐标,但如何让这份严谨从竞赛殿堂走进开发者的日常工具箱,还需要整个社区共同探索。