中文

EvidenceRL:强化证据一致性的可靠语言模型

计算与语言 2026-03-23 v1 信息检索 机器学习

摘要

大型语言模型(LLM)虽然流畅,却容易产生幻觉,生成的答案看似合理却不受可用证据的支持。在决策必须由可验证信息支撑的高风险领域中,这一失效尤为棘手。我们引入EvidenceRL,这是一个强化学习框架,用于在训练期间强制执行证据遵循性。EvidenceRL对候选响应进行评分,评估其依据性(与检索证据和上下文的蕴涵关系)和正确性(与参考答案的一致性),并使用Group Relative Policy Optimization(GRPO)对生成器进行优化。在两个高风险领域中进行评估,心血管诊断和法律推理,EvidenceRL在证据依据性和忠实性方面均表现出一致的改进,同时未牺牲任务准确性。在心血管诊断领域,F1@3从37.0提升至54.5,证据依据性(Gmax@3G_{\max}@3)从47.6提升至78.2;幻觉几乎降低了5倍,基于证据的诊断比例从31.8%提升至61.6%。在法律推理中,EvidenceRL将忠实性从32.8%提升至67.6%,在Llama-3.1-8B模型上显示出在不同领域中行为的一致性变化。我们的代码已开源于https://github.com/Wizaaard/EvidenceRL.git。

关键词

引用

@article{arxiv.2603.19532,
  title  = {EvidenceRL: Reinforcing Evidence Consistency for Trustworthy Language Models},
  author = {J. Ben Tamo and Yuxing Lu and Benoit L. Marteau and Micky C. Nnamdi and May D. Wang},
  journal= {arXiv preprint arXiv:2603.19532},
  year   = {2026}
}