跳到正文

AI Know · 技术研究笔记

输入侧先压缩去重,再进入主模型

分层路由让小模型处理简单步骤;工具调用只授最小权限并全局校验;用成本与幻觉双指标持续评测闭环

听书 00:00 / --:--
00

三分钟读懂

先看结论,再决定是否深读

  1. 输入侧先压缩去重,再进入主模型
  2. 分层路由让小模型处理简单步骤
  3. 工具调用只授最小权限并全局校验
  4. 用成本与幻觉双指标持续评测闭环
编辑提炼01

输入侧先压缩去重,再进入主模型

编辑提炼02

分层路由让小模型处理简单步骤

编辑提炼03

工具调用只授最小权限并全局校验

编辑提炼04

用成本与幻觉双指标持续评测闭环

01 / SYSTEM MAP

一图看懂

输入与上下文推理与执行验证与回滚
02 / DEEP DIVE

核心原理

GPT-5.6 的前沿能力不只体现在更高准确率,更体现在用更少计算和干预获得可靠智能体。当前智能体成本主要来自长上下文反复读取、多步工具调用和冗长输出。指南把“性能”重新定义为:完成有效任务数除以总计算花费,而不是单次回答质量。只有输入、执行、评测三侧同步优化,规模化时才能避免成本失控。

技术细节

03 / IMPLEMENTATION

工程实践

  1. 设置三级预算护栏。把任务分为快速、标准、深度三档,分别限制最大令牌数、最大步数和最长等待时间。达到上限即降级为固定模板、摘要回答或转人工,不允许无界重试。
  2. 建立最小权限工具网关。每个租户和会话使用独立凭证,工具只开放当前任务需要的只读或幂等操作。所有写操作必须携带幂等键并由网关校验参数范围,防止越权或重复执行。
  3. 用影子流量做版本对比。上线新提示词或路由策略前,复制约两成流量并行运行旧版本与新版本,比较完成率、平均花费、延迟和幻觉率。每周把线上失败案例回灌到提示库,形成持续闭环。
04 / EVALUATION

评测与决策

没有可靠公开跑分时使用定性判断,不制造精确数字。

    05 / FAILURE MODES

    风险边界

    成本方面,长尾任务和缓存未命中可能导致花费突增,需要按调用方配额和阶梯限流,自动检测超长会话并强制切换摘要模式。幻觉方面,模型仍可能在工具参数中虚构标识或日期,关键实体必须与数据库回查匹配,输出引用需可追溯。越权调用风险最大,模型可能组合多个低权限工具实现提权,必须在工具层独立鉴权,写操作二次确认,并审计每一次调用链。长尾输入如极端格式、罕见语言和对抗提示,容易造成意图误判或循环,要增加输入规范化、异常检测和超长输入摘要。延迟方面,并行与缓存能改善中位延迟,但复杂推理仍可能产生长尾,应监控第九十五和第九十九百分位,设置超时降级和流式进度,避免无限等待。

    完整信源

    事实从哪里来