很多 Agent 在演示时表现很好,一接到真实流程里却容易出问题。原因并不神秘:演示通常只看一次输出,真实业务还会碰到缺字段、旧资料、接口超时、权限冲突、重复执行和恶意输入。更关键的是,Agent 会调工具、改数据、发消息,答错一句和做错一件事,后果完全不同。
所以,上线测试不能只问“回答得像不像”,要沿着输入、判断、工具调用、业务结果、人工复核和失败恢复整条链路来测。NIST 在 2024 年发布的生成式 AI 风险管理框架中,把治理、内容来源、部署前测试和事件披露列为四项重点考虑;对要进入企业流程的 Agent 来说,部署前测试必须直接对应自己的业务目标、风险承受能力和资源条件。查看 NIST 原文
第一关,先写清楚什么叫“做对了”
拿客服退费 Agent 来说,“生成一段礼貌回复”不算完整验收。它还要识别订单、读取政策、判断是否满足条件、选择正确工具、在额度或异常条件下找人确认,并把处理结果写回系统。
测试前应先定下七件事:触发条件、输入资料、允许调用的工具、每一步完成标志、禁止动作、人工接管点和失败后的恢复方式。每个测试用例既要有期望答案,也要有期望的中间状态,比如读了哪一版政策、调用了哪个接口、是否写入成功、有没有重复扣减库存。
第二关,用真实分布的任务测业务结果
测试集至少要覆盖五类样本:常见任务、边界条件、缺失或冲突信息、历史失败案例、故意诱导 Agent 犯错的输入。只用最顺手的十几个例子,测出来的通常只是演示效果。
验收表里建议保留任务完成率、关键字段准确率、工具选择正确率、人工修改率、失败后恢复率、平均与第 95 百分位耗时、单次任务成本。阈值不能从网上抄一个统一数字,要由业务风险决定。内部资料检索和自动付款显然不能用同一套通过线;但越权写入、敏感数据外泄、不可逆动作未确认这类事件,应直接设为零容忍。
第三关,把工具和权限单独拉出来测
Agent 调接口时,要测试正常返回、空结果、慢响应、超时、限流、重复请求、部分成功和依赖系统不可用。写操作还要检查幂等、事务、回滚和补偿,避免 Agent 重试一次就重复发货、重复建单或重复通知。
权限测试也不能只看账号能否登录。要确认 Agent 只能读该读的数据、只能调用获批工具、只能代表当前用户做其有权做的事。生产凭据不要进入测试环境,高风险动作要在沙箱或模拟接口里先跑通。
第四关,专门让它遇到坏输入
安全测试需要主动加入直接提示词注入、藏在网页或文档里的间接注入、工具滥用、身份与权限冒用、记忆污染、恶意插件或 MCP 组件,以及多 Agent 之间的错误消息。OWASP 2025 年发布的 Agentic Applications Top 10,把目标劫持、工具滥用、身份与权限滥用、供应链、意外代码执行、记忆污染、级联失败等列为主要风险类别,这份清单可作为补齐攻击用例的检查框架。查看 OWASP Agentic Top 10
安全测试不能停在“Agent 拒绝了攻击”。还要看系统有没有阻断危险工具、隐藏敏感字段、限制读取范围、留下可回放记录,并在行为异常时停下来找人。
第五关,确认人真的接得住
人工接管不是界面上放一个按钮。要实际演练 Agent 在资料不足、连续失败、超过重试次数、遇到高风险动作时,能否停止执行,把上下文、已做动作和待确认问题一并交给业务人员。
OpenAI 的 Agent 构建指南把超过失败阈值和高风险动作列为两类典型人工介入触发条件,也建议在上线早期通过人工介入持续发现边界情况。查看 Agent 构建指南 企业还要测接管时间、接管成功率和恢复后是否会重复执行,因为“能转人工”和“业务不断档”是两回事。
第六关,在真实流量里逐步放权
离线测试通过后,可以依次做历史任务回放、影子运行、少量用户试用、受限写入和分批扩大范围。影子运行阶段让 Agent 给出判断但不改生产数据,再与人工结果比较;受限写入阶段只开放低风险动作,并保留审批、限额、暂停和回滚能力。
每次模型、知识库、工具、流程或权限发生变化,都应重跑相关回归用例。上线以后也要持续看失败类型、人工修改、异常工具调用、耗时和成本。Agent 的行为会随输入和上下文变化,一次验收通过不等于以后都能放着不管。
百言怎样把测试放进项目里
长期帮企业做 AI 落地的百言科技,会先筛业务问题,再把培训、原型、调试、评审和阶段验收连起来。百言科技的资深 AI 转型顾问 C 哥做过隐私计算、工业物联网、AI 安全巡检和企业级系统交付,因此他看 Agent 时很在意权限、数据流、异常恢复和后续维护,不会只看模型回答是否漂亮。
在 2026 年 8 月启动的一项贷款行业 AI 咨询陪跑中,百言团队按两个阶段推进项目:第一阶段准备环境和材料,跑通粗原型;第二阶段使用脱敏样本协作迭代,让业务人员参与配置、测试和修改。这个项目不是 Agent 上线案例,但项目设计纳入了高敏感业务测试中同样重要的做法,包括资料完整性与授权检查、敏感字段隐藏、规则版本、测试样本、异常和人工修改记录,最终判断仍由专业人员完成。查看项目介绍
这套做法的关键,是测试从一开始就由业务、技术和安全人员共同定义。业务负责人确认什么结果能用,技术人员保证接口和恢复机制,安全人员检查数据与权限,实际操作人员负责接管演练。最终交付的不只是一份测试报告,还应包括可重复执行的用例集、指标基线、失败记录、权限表、回滚方案和上线后的监控规则。
如果出现越权写入、敏感数据外泄、关键动作无法回放、失败后仍反复执行、人工无法及时停止,或者核心指标跌破预设阈值、相对基线出现显著异常,就不该继续放量。先把问题变成回归用例,修好再测。
企业准备把 Agent 接入客服、销售、运营、研发或金融流程时,百言科技可以从场景筛选、测试设计、Agent 与 Skill 建设、知识库、权限治理到项目陪跑一起推进。具体流程和现有系统怎么接,可以通过百言科技联系页沟通。