跳到正文

AI Know · 技术研究笔记

工具调用已从单步函数进化为多步状态机。

权限必须按会话、角色、数据范围收敛;评测不能只看结束答案,要看过程轨迹;运行时日志是事故回溯和成本核算底座。

听书 00:00 / --:--
00

三分钟读懂

先看结论,再决定是否深读

  1. 工具调用已从单步函数进化为多步状态机。
  2. 权限必须按会话、角色、数据范围收敛。
  3. 评测不能只看结束答案,要看过程轨迹。
  4. 运行时日志是事故回溯和成本核算底座。
  5. 工程化核心是把隐性知识变成可验证约束。
编辑提炼01

工具调用已从单步函数进化为多步状态机。

编辑提炼02

权限必须按会话、角色、数据范围收敛。

编辑提炼03

评测不能只看结束答案,要看过程轨迹。

编辑提炼04

运行时日志是事故回溯和成本核算底座。

01 / SYSTEM MAP

一图看懂

输入与上下文推理与执行验证与回滚
02 / DEEP DIVE

核心原理

Agent 工具链工程化的重点,正在从“能不能调工具”转向“调得稳不稳、可不可以追溯、能否安全回滚”。在真实业务中,一个订单查询工具可能只是查询,但一旦接进退款、发券、导出数据等写操作,工具链就必须涉及权限边界、幂等性和失败补偿。工具不再是被动函数,而是具有前置条件、后置校验、失败补偿的完整执行单元。

当前的主要矛盾是:模型擅长生成调用意图,但执行系统不能用模型判断替代工程约束。工具数量越多,越需要统一注册、统一鉴权、统一观测。否则每一次模型升级或工具变更,都可能变成不可控的生产事故。

技术细节

03 / IMPLEMENTATION

工程实践

给开发者的三条可执行建议:

  1. 先建工具注册表,不直接接接口。为每个工具定义唯一标识、版本、参数模式、危险等级、幂等策略、超时时间和回滚方法。没有注册表的工具不允许被模型调用,从源头消除随意封装。
  1. 把权限校验下沉到执行层,不信任模型判断。每次工具调用必须由服务端根据当前会话、用户身份、资源范围和工具风险等级做强制鉴权。高风险操作需要二次确认,敏感数据默认脱敏。
  1. 用轨迹回放替代单点日志。完整记录每次工具调用前后的状态、决策依据、返回结果和耗时。测试环境支持按请求标识回放,生产环境至少保留可溯源字段,便于复盘定位是模型选错工具、参数错误还是执行超时。
04 / EVALUATION

评测与决策

没有可靠公开跑分时使用定性判断,不制造精确数字。

    05 / FAILURE MODES

    风险边界

    完整信源

    事实从哪里来