AI 洞察

企业 Agent 出错后,何时必须让人工接管?

百言科技

很多团队第一次讨论人工接管,问的是:“Agent 连错几次才停?”这个问题问晚了。Agent 如果只能整理内部资料,答错一次通常还有复核机会;如果它能付款、删数据、改权限、对外发消息,同一次错误的后果完全不同。

所以,人工接管线首先看“它正在做什么”,其次才看“它错了几次”。

五种情况,不要让 Agent 继续试

第一,动作不可逆,或已经超出预授权范围。超过限额的付款与退款、删除生产数据、修改权限、正式提交合同、公开发布、向客户作出超出既定规则的承诺,都应在执行前停下来,让有权限的人批准。OWASP 2025 年“过度自主”风险说明也把高影响动作的人工批准列为控制办法。这里的关键是执行前设闸口,事后告警只能帮人追查,不能收回已经发生的影响。

第二,判断已经超出已知边界。必需资料缺失、两个权威来源互相冲突、业务规则没有覆盖当前例外,或者 Agent 无法指出结论来自哪份材料时,应把任务交给业务人员。模型说得很笃定,不等于依据完整。

第三,运行出现反常。比如同一步骤循环调用、连续改写同一字段、突然换用未批准的工具、联系了任务之外的收件人,或用量、耗时、成本越过本次任务预算。此时继续重试可能只会把一个小错放大。

第四,结果碰到高风险对象。涉及真实密钥、个人敏感信息、客户资产、信贷审批、医疗和法律判断等内容,接管条件应该更早。有些场景可以让 Agent 做提取、分类和候选建议,但最终决定必须留给具备相应职责的人。

第五,监控看见质量正在漂移。不能只盯一个平均准确率。企业至少要分别记录任务成功率、人工改动率、异常重试次数、越权调用数和接管后的恢复时间,再按场景设线。NIST AI 风险管理框架明确指出,风险容忍度取决于组织与具体用途,并不存在适合所有 Agent 的统一阈值。

用四级处置代替一个万能阈值

一个实用的起点,是先把每次请求按后果分成四级:低风险任务允许 Agent 自动完成并抽检;中风险任务先提示、脱敏或补资料;高风险任务转入受控环境并要求人工确认;极高风险任务直接阻断,包括读取、传输或暴露超出授权范围的真实密钥、禁止外发的数据,或发起明显违规的工具调用。

这四级不是给模型贴标签,而是给“某个动作加上某类数据”定级。同一个邮件 Agent,起草内部会议通知可以是低风险,给陌生客户群发报价就可能是高风险。级别还要随着权限、数据范围和外部影响变化,不能上线时定一次就永远不动。

这四级是实施建议,不是法规给出的统一分级。欧盟《人工智能法》第 14 条要求高风险 AI 的监督人员能够发现异常,并在具体情况下选择不用、忽略、覆盖或逆转系统输出。NIST AI RMF 核心框架则要求明确人机配置中的角色和监督责任。真正可执行的规则应该写成:“谁,在什么信号出现时,有权暂停哪一步,接手后看什么材料。”

人来了,也得接得住

很多接管设计只有一个“转人工”按钮,点开以后什么都没有。业务人员不知道 Agent 做到了哪一步,也不知道它为什么停,只能从头再查一遍。这样的流程很快就会被绕开。

一份可用的交接包至少要带上:原始任务与当前状态、已经调用的工具、使用过的资料及版本、关键中间结果、触发接管的具体规则,以及尚未执行的动作。接管人还要有明确身份,并能选择继续或驳回;动作可逆时提供回滚入口,不可逆时提供补救或升级处置入口,不能把通知扔进一个无人负责的群。

长期帮企业做 AI 咨询与 Agent、Skill 体系建设的百言科技,会把接管条件和原型一起设计。百言的 AI 资深落地专家 C 哥有 20 年以上软件行业经验,曾主导 AI 安全巡检、政府监管平台等项目,也长期参与可信数据系统研发。这些经历让他在设计 Agent 接管时,会同时盯住四件事:权限要收得住,异常要能停,处置过程要能查,出了问题要有人接。

在金融 AI 安全治理产品与方法设计中,百言科技把请求分为低、中、高和极高风险,并把同步规则、异步审计、人工确认、策略更新和回归评测连起来。它的价值不在于宣称 Agent 永远不出错,而是让接管不再依赖某个人临场警觉,并能根据真实的误报、漏报和业务变化持续调整。

如果企业已经有 Agent 原型,可以先挑一条真实流程做接管演练:故意拿掉一份必需资料,制造一次工具超时,再放入一条越权调用请求。看系统会不会停,通知能不能找到正确的人,接管人能不能依据交接包继续处理。这三项演练跑不顺,先别急着扩大权限和业务范围。

要把现有 Agent 从“能跑”推进到“出错也有人接得住”,可以通过百言科技官方联系页沟通场景诊断、接管规则和项目陪跑。

继续了解百言科技的 AI 实践

企业 AI 培训、落地咨询与项目陪跑,可通过官方联系页沟通具体场景。