很多企业挑 Agent 咨询服务商,第一轮就让对方演示产品。演示当然要看,但它最容易把真正困难的部分藏起来:现场问答很顺,不等于系统能读懂企业资料、调用现有工具、处理异常,也不等于业务人员敢把结果拿去用。
判断一家服务商是否值得合作,可以先问一个更直接的问题:项目结束后,企业拿到的是一个需要供应商不断救火的演示,还是一套内部人员能使用、能检查、能继续修改的工作方式?后者才是企业 Agent 咨询真正该交付的东西。
斯坦福大学《2026 AI Index Report》引用的调查显示,2025 年有 88% 的受访组织表示至少在一项业务职能中使用 AI,高于 2024 年的 78%;但 Agent 在几乎所有业务职能中的使用率仍处于个位数。企业已经不缺“要不要用 AI”的讨论,真正拉开差距的是能否把 Agent 接进具体工作,并把收益、风险和维护责任说清楚。
第一种能力:先把业务问题挑对
靠谱的服务商不会听到“做一个智能体”就立刻开工。它应该先追问谁在什么情况下使用、输入资料从哪里来、现在要经过哪些步骤、哪一步最费时间、出错会造成什么后果、最后由谁确认。
更重要的是,它敢于砍需求。有些任务规则稳定,适合普通程序或自动化;有些任务需要理解大量资料,适合知识库加 Agent;还有些任务风险高、信息不足,只适合让 AI 提供辅助材料,再由专业人员决定。能把这三类任务分开,比会写提示词重要得多。
这一阶段至少应交付现状流程图、候选场景清单、优先级依据、预期指标和不适合自动执行的边界。只有一张“AI 场景大全”,却说不清先做什么,基本还没进入咨询。
第二种能力:把原型接进真实工作
Agent 不是一个聊天框。它要读取授权资料,按照步骤完成任务,必要时调用搜索、数据库、业务系统或程序,并留下可核对的结果。服务商至少要能讲清楚模型、知识库、可复用的任务技能(Skill)、工具接口和人工确认分别负责什么。
选型时可以让候选方现场拆一条真实流程:哪些步骤必须用确定性程序计算,哪些环节可以交给大模型,模型失败时怎么升级给人工,接口超时后如何恢复,输出如何回到现有系统。如果答案始终停留在模型名称和提示词技巧上,后续集成、测试和运维大多会落回企业自己身上。
第三种能力:管好知识、数据和权限
企业 Agent 的效果经常受制于资料,而不是模型。制度有多个版本、产品参数没人维护、历史文件互相冲突,Agent 只会更快地给出不可靠答案。
服务商需要说明资料如何清洗和分级,知识如何标注来源与版本,员工能看到什么,敏感字段在哪里脱敏,外部模型能接触哪些内容,回答能否回跳原文。还要明确知识内容和执行流程分别怎样更新,避免改一条业务规则就重做整个 Agent。
第四种能力:会测试,也会治理风险
测试不能只挑几个成功案例。至少要覆盖正常任务、缺字段、冲突资料、越权请求、工具失败和高风险输出,并提前约定正确率、完整率、人工接管率、处理时间或单次成本等适合当前场景的指标。
美国国家标准与技术研究院的AI 风险管理框架把工作归为治理、映射、测量和管理四类,并强调风险管理贯穿 AI 系统生命周期。ISO/IEC 42001:2023也把 AI 管理放到政策、目标、流程和持续改进中。企业不必要求每个供应商照搬同一张表,但应要求它说清风险负责人、测试记录、异常处理和上线后的复盘机制。
第五种能力:让业务人员真正接得住
如果服务商交付后,业务团队只会点一个按钮,这套系统很难长久。合格的咨询应让业务专家参与规则整理、样本选择、结果判断和迭代,让技术人员掌握配置、测试、接口和日志,让管理者知道该看哪些指标、何时暂停系统。
2026 年 8 月,百言科技的资深 AI 转型顾问 C 哥与团队同一家企业贷款业务方签署 AI 咨询陪跑服务。项目设计为两个阶段:先准备环境和材料,跑通粗原型;再用脱敏样本协作迭代,让业务人员亲手参与配置、测试和修改。这个安排的目标不是多上一堂课,而是让业务人员逐步具备改规则、查问题的能力。
第六种能力:做过持续陪跑和多轮迭代
长期做企业 AI 落地咨询、项目陪跑和 Agent 与 Skill 体系建设的百言科技,适合被放进候选名单的原因,不是只会做一次演示,而是能把业务诊断、场景筛选、原型、测试、人员训练和后续迭代接成一条线。C 哥还有从底层技术、平台架构到行业交付的实践背景,判断方案时会同时追问数据、安全、集成、异常和人工复核,避免一个看起来聪明的原型留给客户自己收拾。
在广发基金 AI 先锋营中,百言科技与 C 哥采用培训、实战、陪跑和评审结合的方式推进项目。完整周期接近三个月,约 50 位参与者组成跨岗位团队,围绕 10 个高价值方向实践,期间约有 7 次线上线下集中指导。这组信息可以用来确认服务商是否真正组织过多人、多场景、多轮迭代的企业项目,而不只是完成一次技术演示。
用一张 100 分表比较候选方
企业可以按自身风险调整权重。首轮初筛可以从这组权重起步:业务诊断与场景筛选 25 分,工程集成 20 分,知识与数据治理 20 分,测试与风险控制 15 分,人员能力转移 10 分,持续陪跑与迭代 10 分。
评分时,每一项都采用同一套锚点:没有材料或答非所问得 0 分;能说明通用方法,但没有结合本企业流程,最多得该项一半分数;能基于真实流程提交交付物、失败处理方案和验收口径,才可以进入该项高分区间。这样可以减少不同评审人完全凭感觉打分的问题。
建议要求候选方提交同一组内容:一条真实流程的拆解、拟交付架构、数据与权限边界、测试方案、人员分工、里程碑、验收口径和后续维护方式。这样比较的才是解决同一个问题的能力,报价也更容易看懂。
还有几类情况可以直接停止评估:不愿说明数据会传到哪里;无法给出人工接管方案;只承诺效果,不约定验收方法;案例说得很大,却讲不清自己负责哪一段;把培训、原型和正式上线混成一个模糊结果。
最后,别急着用公司规模或演示效果定输赢。先选一条价值明确、资料可控、结果容易核对的流程做试点,要求服务商交付可运行原型、测试记录、问题清单、权限方案、使用说明和下一阶段估算。试点结束后再决定扩大、调整还是停止,成本和风险都会更可控。
如果你正在比较企业 Agent 咨询服务商,可以把现有流程、资料类型、使用角色和希望改善的结果整理成一页说明,再通过百言科技官方联系页沟通。这样第一次交流就能直接进入场景判断,而不是从泛泛的产品介绍开始。