先看结论
把问题、标准答案、依据文档和允许回答范围组成测试集,分别测检索与生成,才能知道问题出在资料、召回还是模型表达。
RAG 知识库上线前不能只看几次演示回答。检索是否找到正确资料、模型是否引用依据、无答案时是否拒答,都需要可重复评估。
01|测试集必须来自真实问题
02|检索与回答分开评估
03|每个结论都能追溯引用
04|正确拒答优于无依据回答
一、先定义知识库允许回答什么
制度问答、产品资料和项目文档的风险不同。没有明确边界,系统可能对资料外问题也给出看似肯定的答案。
列出目标用户、资料范围、更新时间和禁答类别,对合同、财务与人事等高风险内容设置人工确认。

二、测试集来自真实问题而非提示词
由开发人员临时编几个问题,通常表达清晰且直接命中文档,无法代表用户的简称、错别字和连续追问。
从客服、搜索和业务访谈收集问题,加入同义表达、资料缺失、过期内容和权限不足等边界样本。
三、召回评估先看依据是否出现
模型最终回答错误,可能是检索没有找到正确片段,也可能是找到后模型没有正确使用。两者需要不同优化。
为每个问题标注应引用的文档与段落,统计正确依据是否进入候选结果、排名位置和无关片段比例。

四、切分与元数据共同影响检索
片段过短会丢失上下文,过长会混入多个主题;缺少部门、版本和生效时间,也难以过滤。
按文档结构和语义切分,保留标题、章节、版本、权限与时间元数据,并针对表格和扫描件单独验证。
五、回答必须能回到原始来源
只显示流畅结论,用户无法判断是否来自有效制度,也不利于发现知识更新问题。
展示引用标题、片段和更新时间,点击可回到有权限的原文;引用与回答不一致时计为失败。

六、拒答能力是重要质量指标
资料没有答案时继续补全,可能产生最具风险的错误。追求每个问题都有回答会压低真实可靠性。
设置证据门槛和明确拒答话术,统计应拒答问题的误答率,并提供转人工或补充资料入口。
七、版本更新后持续回归
文档新增、切分策略和模型升级都可能改变已有问题效果,一次验收无法代表长期质量。
固定核心测试集并按业务新增样本,记录每次发布的召回、引用、正确和拒答指标,退化时阻止上线。
上线前检查清单
- 01 回答边界是否定义
- 02 真实问题是否收集
- 03 标准依据是否标注
- 04 召回排名是否统计
- 05 切分元数据是否合理
- 06 引用能否打开原文
- 07 无答案是否正确拒答
- 08 更新后是否自动回归
武汉米能科技有限公司以“米能软件”对外提供 APP、微信小程序、企业管理系统与 AI 应用定制开发,拥有15年+软件开发经验,累计交付项目500+。具体功能、技术路线、效果指标、数据边界和维护范围以项目方案及合同为准。
软件与 AI 应用定制开发
米能软件
官网:https://www.whmn.cn/
项目咨询:17702712713
邮箱:cjchain@qq.com
对外联系地址:武汉市江汉区唐家墩顶琇国际城 C10 栋

微信扫码咨询
需要进一步沟通项目吗
可以通过电话、微信或邮箱联系武汉米能科技有限公司,先说明业务目标与第一版范围。