跳到正文

AI Know · 技术研究笔记

2800 亿参数采用稀疏专家混合降低推理成本

面向长程智能体的多轮记忆与工具调用;多模态输入被统一离散化为可推理序列;开源权重与评测集显著降低复现门槛

听书 00:00 / --:--
00

三分钟读懂

先看结论,再决定是否深读

  1. 2800 亿参数采用稀疏专家混合降低推理成本
  2. 面向长程智能体的多轮记忆与工具调用
  3. 多模态输入被统一离散化为可推理序列
  4. 开源权重与评测集显著降低复现门槛
  5. 仍需防范越权调用与长尾延迟风险
编辑提炼01

2800 亿参数采用稀疏专家混合降低推理成本

编辑提炼02

面向长程智能体的多轮记忆与工具调用

编辑提炼03

多模态输入被统一离散化为可推理序列

编辑提炼04

开源权重与评测集显著降低复现门槛

01 / SYSTEM MAP

一图看懂

输入与上下文推理与执行验证与回滚
02 / DEEP DIVE

核心原理

dots3-note Preview 的开源在智能体与多模态推理方向引发关注。它的参数规模达到 2800 亿,却被称为轻量模型,关键不在于总参数少,而在于推理时只有少量参数被激活。该模型把重点放在长程智能体任务上:不是只回答单轮问题,而是能够在数小时甚至数天的任务中保持状态、调用工具、读取环境反馈并进行下一步决策。

与此前许多模型只刷单轮榜单不同,dots3-note Preview 更强调真实工作流中的完成率。它可以处理截图、表格、音频、文档等多种输入,并在浏览器、命令行、办公软件等环境中执行动作。开源的不仅是权重,还包括记忆模块、工具调用协议和长程评测集。社区可以基于它复现长时任务、测试智能体的稳定性,并改造为面向客服、数据整理、自动化运维等场景的底座。

技术细节

03 / IMPLEMENTATION

工程实践

开发者落地时建议先做三件事。

第一,不要试图直接加载 2800 亿参数全量权重。优先使用官方提供的量化版本或专家卸载方案,把激活参数控制在单卡或小集群可承受范围内,同时预留显存给外部记忆与工具执行进程。

第二,在开放工具调用之前必须接入沙箱与权限白名单。限制可执行命令、网络域名、文件路径和环境变量,所有动作写入审计日志,支持回放与暂停。删除、发送、支付等敏感操作应增加二次确认或人工审批。

第三,先选择可回滚的低风险场景试点,例如内部知识库问答、报表整理、工单分类。确认动作稳定性与延迟可接受后,再扩展到浏览器操作、订单处理等高风险任务,并为每个任务设置最大步数与超时熔断。

04 / EVALUATION

评测与决策

没有可靠公开跑分时使用定性判断,不制造精确数字。

    05 / FAILURE MODES

    风险边界

    成本方面,稀疏激活虽然降低单次推理成本,但长程任务会产生大量中间 token。多模态编码、记忆写入与检索、工具执行环境都会增加额外算力与存储开销。上线前需要按任务类型估算成本上限,避免长任务失控消耗资源。

    幻觉风险在长程场景中被放大。记忆压缩会丢失细节,模型可能对模糊记忆进行自信补全,生成看似合理但错误的事实。需要要求模型标注证据来源,并对关键结论做外部检索或规则校验。

    越权调用是最直接的安全风险。智能体一旦获得工具权限,可能误删文件、重复提交表单、发送错误消息,甚至被诱导执行高风险命令。最小权限、动作白名单、敏感操作人工确认必须作为默认配置,而不是可选功能。

    长尾输入与延迟同样不可忽视。异常尺寸图像、复杂嵌套表格、模糊截图或格式错乱的文档会导致编码时间骤增或解码失败。应在前置阶段做输入校验,对超时请求直接拒绝并降级为人工处理,防止长尾样本拖垮线上服务。

    完整信源

    事实从哪里来