RAG企业知识库答错,常常不是因为模型不够大,而是文档过期或矛盾、内容切分丢失上下文、检索没有找到正确片段、权限过滤错误、问题口径不清,或者系统在没有依据时仍被要求回答。

原因一:知识源本身不可靠
同一制度存在多个版本、产品参数分散在不同文件、历史文档没有失效标记,系统即使检索成功,也可能引用错误来源。应为知识设置负责人、版本、适用范围和更新时间。
原因二:文档切分破坏上下文
如果标题、表格、条件和例外条款被切到不同片段,检索到的文字可能只包含结论而没有适用条件。切分策略应结合文档结构,而不是固定按字符数量处理所有资料。
原因三:检索召回不准确
企业术语、产品别名、编码和缩写可能与用户问法不同。需要建立术语表、同义词、元数据过滤和必要的混合检索,并用真实问题持续测试。
原因四:权限设计不完整
知识库不仅要“找得到”,还要确保用户只能看到有权限的内容。权限过滤如果放在生成之后,可能已经造成信息泄露。应在检索阶段就应用组织、岗位和资料级权限。
原因五:缺少拒答与转人工
当检索证据不足、来源冲突或问题超出范围时,系统应明确说不知道,展示已找到的资料并建议转人工,而不是为了回答完整而补全事实。
怎样验收RAG知识库
- 用真实问题同时测试正确答案、无答案和无权限问题;
- 检查引用是否指向正确文档、章节和版本;
- 记录错误属于知识、检索、生成还是权限问题;
- 比较人工修改和拒答情况,持续维护测试集。
鸿图智企的AI知识管理智能体强调来源引用、权限隔离和持续更新,而不是只追求回答流畅。
常见问题(FAQ)
RAG答错就应该换更大的模型吗?
不一定。应先定位错误发生在知识源、切分、检索、权限、生成还是问题口径,再决定是否更换模型。
文档导入知识库后是否可以长期不维护?
不可以。需要记录版本、适用范围、负责人和更新时间,并及时停用过期或冲突资料。
怎样判断检索是否准确?
检查回答引用的文档、章节、版本和适用条件是否正确,并使用真实问题持续维护测试集。
找不到答案时系统应该怎么做?
应明确拒答或说明证据不足,展示已找到的来源,并提供转人工路径。
参考资料与方法说明
本文依据公开规范与企业AI实施方法整理,用于场景评估和项目准备参考,不构成针对特定企业的法律意见。