2026 年 7 月,OpenAI 正式发布 ChatGPT Work,一个可以跨应用自主完成任务的智能体。与生成式聊天窗口不同,它不再停留在回答问题的层面,而是直接接管鼠标键盘、理解屏幕元素、操作第三方软件,像人类一样在多步骤工作流中执行操作。其意义在于,大模型从“建议者”变为“执行者”,AI 与数字劳动的边界被实质性压缩。

💡 划重点

  • 跨应用自主操作,非浏览器插件,而是系统级智能体
  • 基于屏幕像素与控件树双通道理解界面
  • 支持工具注册、权限分级与回滚机制
  • 每日任务通过自然语言描述即可配置,无需 API
  • 在复杂 UI 变化场景中容忍延迟,但仍有误触风险

核心话题

ChatGPT Work 不是在 ChatGPT 内嵌一个宏录制器,而是一个具备规划、视觉理解与动作执行的完整代理。用户用自然语言描述目标,比如“每天下午 4 点从 Outlook 汇总当日待办,生成 Excel 报表并存到 Teams 指定频道”,它就能像人一样打开对应程序,读取、解析、操作并交付结果。它不是应用内插件,而是通过系统权限获取屏幕内容,模拟键鼠事件,因此几乎可以操控任何有图形界面的软件。这意味着,大量横跨多个工具、重复性高但规则模糊的白领工作,第一次可以被原生 AI 接管,而不需要对每个软件做定制集成。

技术细节

要让一个模型安全地在真实操作系统中跨应用工作,挑战集中在输入侧、推理执行侧和输出评测侧。

输入侧

ChatGPT Work 的感知来源是双通道:屏幕像素流与操作系统辅助功能树。像素流通过屏幕捕获接口以每秒若干帧输入视觉编码器,帮助模型理解界面布局、图标、色彩与遮挡关系;辅助功能树则提供控件类型、标签、属性与层级,让模型精确定位按钮、输入框。两者融合后,模型对界面的理解不再依赖固定坐标,而是动态解析语义,即使界面发生局部变化,也能通过视觉和结构双重信号重新定位目标元素。

推理与执行侧

模型接收到任务描述和当前界面状态后,内部进行分层规划:高层任务分解、中层动作序列生成、底层原子动作(点击、输入、拖拽、等待)。规划器会持续评估是否偏离目标,必要时进行局部重试。执行阶段由“动作执行器”将模型输出的动作指令翻译为系统级事件,并加入人为不可察觉的随机延时,以规避部分应用的机器人检测。为防止任务阻塞,模型被训练识别常见的错误对话框、权限请求弹窗,并调用相应应对策略。

输出与评测侧

任务完成后,模型生成执行摘要,包含步骤列表、各步骤结果、置信度标记以及可能的风险提示。评测不仅看任务最终是否完成,还关注过程效率、误操作率与安全边界。OpenAI 采用了仿真环境回放与真实用户判断相结合的双重评测,把数十万个跨应用任务拆解为可度量的原子指标,如“元素定位准确率”、“操作成功率”、“中断恢复率”。

工程落地

开发者与企业希望在现有工作流中接入 ChatGPT Work,有三条可执行建议。

第一,建立任务原子库并提前定义权限边界。不要一开始就把所有应用和系统权限开放给智能体,而是逐一注册工具和任务模板。将高频操作封装成“已验证原子动作”,让模型在有限的可用原子上进行组合,既降低失控风险,也方便审计。

第二,构建影子测试与逐级放量。先在非生产环境和专用账号上运行,用录屏与日志完整记录操作轨迹。当失误导致文件覆盖或误发送时,版本回滚与沙箱数据保护必须前置。只有通过一致性检查、误触率低于阈值后,才逐步将任务交给真实工作流。

第三,为人类监督设计阻断与修正点。即使全自动运行,也要将高风险步骤(如外发邮件、写入数据库、删除记录)设为“需人工确认”。同时提供干预接口,让用户可随时暂停,并通过对界面的自然语言纠正操作路径,逐步积累训练数据以提升模型鲁棒性。

风险边界

成本

持续屏幕捕获、高频推理与操作系统深度交互,算力消耗显著高于对话场景。长时间任务可能累积较高推理次数,按 token 计费时,完成一个半小时的多步骤流程,成本可能远超同等时长的人工工资。对中小企业,需要精细衡量哪些任务值得自动化。

幻觉与界面误读

模型虽融合辅助功能树,但依旧依赖视觉理解。当 UI 出现罕见控件、非标准图标或字体渲染差异,可能产生误识别,导致点击无效区域,甚至在文件菜单中执行错误选项。幻觉不会消失,只是从文本域迁移至操作域,一旦误删数据或误发布内容,后果更严重。

越权调用

智能体获得系统级操作权限后,理论上可操作任何无密码保护的应用。即使有权限分级与动作审计,恶意提示注入(将任务诱导至敏感操作)或模型自身目标偏差,都可能突破权限边界。例如,一个看似无害的“整理桌面”,若模型误将压缩包释放至启动目录,就可能引入安全风险。

长尾输入与延迟

对于罕见语言的界面、重度个性化主题或极慢的响应应用,模型可能频繁超时或重复操作。网络波动也可能导致任务中断,如何优雅降级和断点续传是工程难题。此外,若任务涉及多个云服务,任何一端延迟都会放大整体执行时间,带来不确定的等待成本。