输入侧先压缩去重,再进入主模型
AI Know · 技术研究笔记
输入侧先压缩去重,再进入主模型
分层路由让小模型处理简单步骤;工具调用只授最小权限并全局校验;用成本与幻觉双指标持续评测闭环
三分钟读懂
先看结论,再决定是否深读
- 输入侧先压缩去重,再进入主模型
- 分层路由让小模型处理简单步骤
- 工具调用只授最小权限并全局校验
- 用成本与幻觉双指标持续评测闭环
分层路由让小模型处理简单步骤
工具调用只授最小权限并全局校验
用成本与幻觉双指标持续评测闭环
一图看懂
输入与上下文→推理与执行→验证与回滚
核心原理
GPT-5.6 的前沿能力不只体现在更高准确率,更体现在用更少计算和干预获得可靠智能体。当前智能体成本主要来自长上下文反复读取、多步工具调用和冗长输出。指南把“性能”重新定义为:完成有效任务数除以总计算花费,而不是单次回答质量。只有输入、执行、评测三侧同步优化,规模化时才能避免成本失控。
技术细节
工程实践
- 设置三级预算护栏。把任务分为快速、标准、深度三档,分别限制最大令牌数、最大步数和最长等待时间。达到上限即降级为固定模板、摘要回答或转人工,不允许无界重试。
- 建立最小权限工具网关。每个租户和会话使用独立凭证,工具只开放当前任务需要的只读或幂等操作。所有写操作必须携带幂等键并由网关校验参数范围,防止越权或重复执行。
- 用影子流量做版本对比。上线新提示词或路由策略前,复制约两成流量并行运行旧版本与新版本,比较完成率、平均花费、延迟和幻觉率。每周把线上失败案例回灌到提示库,形成持续闭环。
评测与决策
没有可靠公开跑分时使用定性判断,不制造精确数字。
风险边界
成本方面,长尾任务和缓存未命中可能导致花费突增,需要按调用方配额和阶梯限流,自动检测超长会话并强制切换摘要模式。幻觉方面,模型仍可能在工具参数中虚构标识或日期,关键实体必须与数据库回查匹配,输出引用需可追溯。越权调用风险最大,模型可能组合多个低权限工具实现提权,必须在工具层独立鉴权,写操作二次确认,并审计每一次调用链。长尾输入如极端格式、罕见语言和对抗提示,容易造成意图误判或循环,要增加输入规范化、异常检测和超长输入摘要。延迟方面,并行与缓存能改善中位延迟,但复杂推理仍可能产生长尾,应监控第九十五和第九十九百分位,设置超时降级和流式进度,避免无限等待。