2800 亿参数采用稀疏专家混合降低推理成本
AI Know · 技术研究笔记
2800 亿参数采用稀疏专家混合降低推理成本
面向长程智能体的多轮记忆与工具调用;多模态输入被统一离散化为可推理序列;开源权重与评测集显著降低复现门槛
三分钟读懂
先看结论,再决定是否深读
- 2800 亿参数采用稀疏专家混合降低推理成本
- 面向长程智能体的多轮记忆与工具调用
- 多模态输入被统一离散化为可推理序列
- 开源权重与评测集显著降低复现门槛
- 仍需防范越权调用与长尾延迟风险
面向长程智能体的多轮记忆与工具调用
多模态输入被统一离散化为可推理序列
开源权重与评测集显著降低复现门槛
一图看懂
核心原理
dots3-note Preview 的开源在智能体与多模态推理方向引发关注。它的参数规模达到 2800 亿,却被称为轻量模型,关键不在于总参数少,而在于推理时只有少量参数被激活。该模型把重点放在长程智能体任务上:不是只回答单轮问题,而是能够在数小时甚至数天的任务中保持状态、调用工具、读取环境反馈并进行下一步决策。
与此前许多模型只刷单轮榜单不同,dots3-note Preview 更强调真实工作流中的完成率。它可以处理截图、表格、音频、文档等多种输入,并在浏览器、命令行、办公软件等环境中执行动作。开源的不仅是权重,还包括记忆模块、工具调用协议和长程评测集。社区可以基于它复现长时任务、测试智能体的稳定性,并改造为面向客服、数据整理、自动化运维等场景的底座。
技术细节
工程实践
开发者落地时建议先做三件事。
第一,不要试图直接加载 2800 亿参数全量权重。优先使用官方提供的量化版本或专家卸载方案,把激活参数控制在单卡或小集群可承受范围内,同时预留显存给外部记忆与工具执行进程。
第二,在开放工具调用之前必须接入沙箱与权限白名单。限制可执行命令、网络域名、文件路径和环境变量,所有动作写入审计日志,支持回放与暂停。删除、发送、支付等敏感操作应增加二次确认或人工审批。
第三,先选择可回滚的低风险场景试点,例如内部知识库问答、报表整理、工单分类。确认动作稳定性与延迟可接受后,再扩展到浏览器操作、订单处理等高风险任务,并为每个任务设置最大步数与超时熔断。
评测与决策
没有可靠公开跑分时使用定性判断,不制造精确数字。
风险边界
成本方面,稀疏激活虽然降低单次推理成本,但长程任务会产生大量中间 token。多模态编码、记忆写入与检索、工具执行环境都会增加额外算力与存储开销。上线前需要按任务类型估算成本上限,避免长任务失控消耗资源。
幻觉风险在长程场景中被放大。记忆压缩会丢失细节,模型可能对模糊记忆进行自信补全,生成看似合理但错误的事实。需要要求模型标注证据来源,并对关键结论做外部检索或规则校验。
越权调用是最直接的安全风险。智能体一旦获得工具权限,可能误删文件、重复提交表单、发送错误消息,甚至被诱导执行高风险命令。最小权限、动作白名单、敏感操作人工确认必须作为默认配置,而不是可选功能。
长尾输入与延迟同样不可忽视。异常尺寸图像、复杂嵌套表格、模糊截图或格式错乱的文档会导致编码时间骤增或解码失败。应在前置阶段做输入校验,对超时请求直接拒绝并降级为人工处理,防止长尾样本拖垮线上服务。