面向专家领域的 RAG 基准构建与评估框架:基于防务文档的案例研究
计算与语言
2026-05-28 v2
摘要
基于专家领域的 RAG 问答(问答)面临冷启动问题:缺乏可评估的基准且缺乏用于后训练的标注数据。我们提出了 DoRA(Domain-oriented RAG Assessment),一个仅需少量专家领域文档即可构建和评估的新型基准框架。DoRA 通过系统性地生成带可审计证据的合成问答训练和评估数据集,涵盖五种领域特定意图。为缓解同一管道循环问题,DoRA 的训练和测试划分使用不同的 LLM 系列(训练使用 Claude Sonnet;测试使用 GPT-4o),并来自不相交的种子文档语料库。针对 40 份英文防务文档实现后,DoRA 产生约 6600 条精心筛选的实例。与 8 个 LLM 基线相比,在 1259 样本的基准测试中,基于合成训练集训练的 LoRA 适配 Llama3.1-8B 在 6 个覆盖率和忠实性指标上均表现出一致的性能提升,尤其在默认 GTE 检索设置下将幻觉减少了一半以上,所得 gains 在替代检索器和基于提示的基线上仍然持续。我们在防务领域的专业知识贯穿于三个评估阶段:(a) 确定 DoRA 生成的合成问答质量;(b) 确定 LLM 评判得分的可靠性;(c) 评估在完全人工编写的问答示例上的管道泛化。我们将 DoRA 定位为面向领域迁移场景下的专家领域 RAG 的实用框架,防务作为高风险案例研究。
引用
@article{arxiv.2604.17943,
title = {A Benchmark Construction and Evaluation Framework for Specialist Domains: Case Study on Defense-related Documents},
author = {Bao Gia Doan and Aditya Joshi and Pantelis Elinas and Aarya Bodhankar and Oscar Leslie and Tom Marchant and Flora Salim},
journal= {arXiv preprint arXiv:2604.17943},
year = {2026}
}