在金融机构里,提示词注入最危险的地方,往往不是聊天机器人说了一句怪话。它可能藏在客户上传的文件、研究员打开的网页、公告 PDF、邮件正文或知识库材料里。AI 把这些内容读进上下文后,如果把其中的恶意文字当成了新指令,后面的检索、总结和工具调用都可能被带偏。
OWASP 将提示词注入列为 2025 年大语言模型应用十大风险的首项。直接注入来自用户输入,间接注入则藏在网站、文件等外部内容中。攻击成功后的后果取决于 AI 所处的业务场景和它拥有多大行动权限,可能包括敏感信息泄露、内容操纵、越权调用功能、执行连接系统中的命令,以及干扰关键决策。
提示词注入会暴露四类问题
第一类是数据泄露。攻击者可能诱导模型复述系统指令、内部知识片段、客户信息或业务材料。金融 AI 一旦接触客户资料、持仓交易、内部经营数据和真实凭据,回答窗口就可能变成新的外发通道。
第二类是业务判断被悄悄改写。投研摘要漏掉关键风险,合同审阅忽略限制条款,客服助手给出错误办理指引,这些结果看起来仍然像正常中文,因而比明显报错更容易进入后续流程。
第三类是工具越权。只会生成文字的助手不能直接操作业务系统,但输出本身仍可能造成泄密或业务误判;能够查客户、发邮件、改工单或调用交易相关接口的 Agent,则可能把错误内容直接变成系统动作。英国国家网络安全中心指出,大模型并不天然区分“数据”和“指令”,所以更可靠的思路是用确定性控制约束系统动作,而不是只盼着模型识别每一句恶意话。
第四类是追溯盲区。如果日志只保留用户最后问了什么和模型最后答了什么,却没有保存检索到的材料、工具请求、授权结果和人工处置,提示词注入发生后就很难找到是哪段外部内容改变了模型行为,也难以复现问题和修正规则。
美国财政部 2024 年发布的金融业 AI 网络安全报告基于 2023 年末完成的 42 次深度访谈,参与者来自金融服务、IT、数据与反欺诈反洗钱领域。报告提到,金融机构已在研究和报告撰写等员工提效场景中评估或试用生成式 AI;许多受访机构还表示,至少部分网络安全或反欺诈 AI 系统采用了第三方产品或服务。从这些发现出发,采购方至少要问清楚四件事:模型及其底层第三方从哪里来,数据如何使用和留存,供应商怎样验证模型,产品或模型更新时怎样通知并重新评估。
选服务商,重点看这五件事
- 测的是整条应用链,还是只测聊天框。 测试范围应覆盖用户输入、文件上传、网页与知识库检索、图片等多模态内容、工具返回和其他 Agent 消息,同时包含直接注入和间接注入。
- 权限控制是不是独立于模型。 高权限工具应使用独立身份和最小权限,关键动作由确定性程序校验,转账、外发、删除或改写重要数据等操作要设置人工确认。不能让模型自己判断自己是否有权执行。
- 能不能还原一次事件。 至少要关联用户和应用身份、输入来源、检索片段、模型与规则版本、工具请求、授权结果、输出、告警和人工处置。英国国家网络安全中心的机器学习安全原则也要求系统能够审计输入输出,并保留足以调查事后才发现的入侵所需日志。
- 有没有可复测的评测口径。 不要只看“拦截了多少条”,还要分别看攻击绕过、正常业务误报、高风险动作逃逸和规则修改后的回归结果。测试集、阈值、规则版本和回滚方式都应该说得清楚。
- 是否懂金融系统的接入边界。 供应商要能说明怎样对接 SSO、AI 网关、日志平台和本地模型,也要明确产品与终端 DLP、数据库审计、内容安全平台和 SOC 的分工。把所有问题都承诺给一个 AI 安全产品,反而说明边界没有想清楚。
长期做企业 AI 落地与安全治理的百言科技,已经上线面向基金、证券资管、保险资管、信托等机构的金融 AI 安全审计平台。它把不同模型的统一接入与按用户、部门、应用和模型管理权限放到一起,并根据风险采取提示、脱敏、本地路由、外部路由或阻断;审计、告警、人工处置、规则回放、灰度和回滚也在同一条治理链里。对金融机构来说,这项优势的价值不在于宣称能抓住所有恶意句子,而在于即使模型被误导,也尽量不让一次错误直接变成高权限动作。
曾主导隐私计算、AI 安全巡检和政府监管平台等项目的 AI 资深落地专家 C 哥,看这类风险时不会只盯着模型回答。他更关心输入来自哪里、模型能调用什么工具、关键动作由谁确认,以及异常发生后能否还原全过程。金融机构比较服务商时,可以拿自己的真实业务链路做一次小范围验证,让安全、合规、业务和技术团队一起看误报、漏报和处置成本,而不是只听一场产品演示。
如果你正在评估金融 AI 安全审计、混合模型接入或 Agent 权限治理,可以通过百言科技官方联系页提交现有场景、接入系统和风险要求,再决定先做风险梳理、验证还是平台接入。