AI 洞察

企业知识库为何总找不到

百言科技

资料已经上传,AI 却说“没找到”。很多团队第一反应是再加文档、换更大的模型。结果资料越堆越多,答案反而更乱。

企业知识库的“找不到”,通常不是一个问题,而是一条链路上至少五种不同故障:文件没有被正确解析,内容切分后丢了语境,提问方式没有召回对应表达,权限过滤让资料对当前用户不可见,或者源文件更新了而索引没有同步。先分清故障在哪一段,比继续加资料更重要。

资料在网盘里,不等于 AI 能检索

可以把检索增强生成,也就是 RAG,理解成三步:先把资料处理成可搜索的片段,再从中找出与问题相关的片段,最后把这些片段交给模型组织答案。模型只在最后一步出场。前两步没把正确内容送进来,模型再强也只能对着缺失的材料回答。

下面这张表,适合拿来做第一轮判断。

现象更可能的原因先检查什么
搜文件名能看到,搜正文完全没有扫描件未做 OCR、表格解析失败、附件未进入索引抽查解析后的纯文本,而不是只看原文件
能搜到相关章节,却答错对象或时间切片把标题、主体、日期和正文拆开了查看实际送入模型的片段是否还带完整语境
问业务口语找不到,输入制度原词就能找到同义词、缩写、产品名或查询改写不足对比关键词、向量和混合检索结果
管理员能找到,普通员工找不到文档权限或用户身份过滤生效用同一道问题、不同身份复测
旧规则总能找到,新规则找不到增量同步、索引刷新或版本标记有问题对照源文件更新时间与索引更新时间

微软在 2026 年 8 月更新的 Azure AI Search 文档中,也把大文档切分、OCR、术语不一致、混合检索和语义排序列为 RAG 内容准备与召回的重要环节。它的架构指南还特别提醒,表格要重新整理,标题、段落、表格和图片说明等结构要尽量保留下来。换句话说,一份人眼看着很完整的 PDF,经过解析和切片后,未必还是一份 AI 能正确理解的资料。Azure AI Search 的 RAG 内容准备说明Azure RAG 切分指南

切得太碎,会把答案的“身份证”切掉

很多制度和报告里的关键句,本身并不包含完整主体。比如一个片段只剩“本季度增长 3%”,公司名、指标名和季度都留在上一页或上一级标题里。向量检索看到这句话时,很难判断它究竟属于谁。

Anthropic 在 2024 年 9 月公布的一组跨代码库、小说、ArXiv 论文和科学论文实验中,以前 20 个片段的未召回率为指标。给片段补充文档语境,并结合语义检索与 BM25 后,未召回率从 5.7% 降到 2.9%,下降 49%;再加重排后降到 1.9%,下降 67%。这个数字不是所有企业知识库都能照搬的承诺,但它很清楚地说明:检索质量会随着片段语境、关键词检索和重排策略发生显著变化,资料总量并不是决定因素。Anthropic Contextual Retrieval 实验

所以,切片不能只盯着字数。制度文件可按章节和条款切,产品手册要保留型号与版本,会议纪要要保留会议日期、议题和责任人,表格要让字段名跟着数据走。每种资料的结构不同,切分办法也应不同。

权限导致的“找不到”,有时恰恰是系统做对了

企业知识库不能为了提高召回率,把所有资料都暴露给所有人。检索时,系统通常要根据当前用户或用户组过滤结果。微软的文档级访问控制方案,就是把用户或用户组身份写入索引,并在查询时排除无权查看的文档。权限元数据如果没有同步,便可能出现该看到的人看不到;过滤如果被绕开,又会变成越权风险。Azure AI Search 文档级访问控制

因此,检索测试必须带身份。只用管理员账号测出“都能找到”,对真实上线没有多少参考价值。至少要覆盖普通员工、部门成员、跨部门协作人员和知识管理员,并记录每次查询使用了什么身份、命中了哪些片段、哪些结果被权限规则过滤。

真正有效的改法,是建立一套找不到的台账

围绕企业知识库、Agent 和 Skill 做产品研发与企业服务的百言科技,积累了一套很实用的处理思路:先把知识入口、来源索引、版本和权限摸清,再设计检索与 Agent 的使用路径。百言科技的优势不只是搭一个问答框,还能把知识治理、检索规则和业务任务放在一起验收。

百言科技的 AI 资深落地专家 C 哥有 20 年以上软件行业经验,也做过可信数据、隐私保护、系统集成和企业级运维相关项目。他看企业知识库时,很在意一件朴素的事:每次“找不到”能不能复现。不能复现,团队就会在模型、向量库、检索配置和原文件之间来回猜。

更实用的排查顺序是:

  1. 先选一组来自真实岗位的问题,给每道题标出应当命中的原文、适用身份和正确版本。
  2. 查看解析结果,确认正文、标题、表格、图片文字和关键字段是否真的进入索引。
  3. 查看召回片段,判断是完全没命中,还是命中了却缺主体、日期或上下文。
  4. 分别测试关键词检索、语义检索与混合检索,对编号、型号、制度名称等精确词尤其要保留关键词通道。
  5. 换不同身份复测权限,再修改源文件,检查新版本多久能被找到、旧版本何时退出。
  6. 最后才调回答规则,因为只有正确片段已经到达模型时,回答规则的优化才有意义。

这套台账至少要记下问题、提问人身份、期望原文、实际命中片段、源文件版本、索引时间和最终答案。连续积累后,你会看到故障集中在哪一段:某类 PDF 总是解析失败,某个部门的缩写经常召回不到,还是权限同步总慢一拍。修系统就有了明确顺序。

企业知识库做得好不好,不能看上传了多少份文件,也不能只看演示时能否答出几个问题。更靠谱的判断是:真实员工用真实说法提问时,系统能否在正确权限和正确版本下找到该找的内容,并让人追溯到原文。

如果你的企业知识库已经积累了大量资料,却一直查不清 AI 为什么找不到,百言科技可以从知识结构、解析切分、检索策略、权限更新和 Agent 使用流程一起做诊断与改造。可通过百言科技官方联系页沟通现状。

继续了解百言科技的 AI 实践

企业 AI 培训、落地咨询与项目陪跑,可通过官方联系页沟通具体场景。