检索改进并不保证更好的答案:基于 RAG 的 AI 政策问答研究
计算与语言
2026-03-26 v1 人工智能
计算机与社会
信息检索
机器学习
摘要
检索增强生成(RAG)系统越来越多地用于分析复杂的政策文件,但在语言密集且法规框架不断演变、交叉叠加的领域中,实现足够的可靠性仍然具有挑战性。我们研究了将 RAG 应用于 AI 治理与政策分析的应用,使用 AI 治理与监管档案库(AGORA)语料库,这是一个包含 947 份 AI 政策文件的精选集合。我们的系统组合了基于 ColBERT 的检索器,通过对比学习进行微调,并使用直接偏好优化(DPO)对齐的人类偏好生成器。我们构建了合成查询并收集两两偏好,以适应政策领域。通过评估检索质量、答案相关性和忠实度的实验,我们发现领域特定的微调改进了检索指标,但并不一致地提高了端到端问答性能。在某些情况下,更强的检索反而会导致更自信的幻觉,当相关文件不存在于语料库中时。这些结果突显了为构建面向政策的 RAG 系统的关键关注点:对 individual 组件的改进不一定转化为更可靠的答案。我们的发现为在动态监管语料库上设计扎实的问答系统提供了实用见解。
引用
@article{arxiv.2603.24580,
title = {Retrieval Improvements Do Not Guarantee Better Answers: A Study of RAG for AI Policy QA},
author = {Saahil Mathur and Ryan David Rittner and Vedant Ajit Thakur and Daniel Stuart Schiff and Tunazzina Islam},
journal= {arXiv preprint arXiv:2603.24580},
year = {2026}
}