EvidenceRL:强化证据一致性的可靠语言模型
计算与语言
2026-03-23 v1 信息检索
机器学习
摘要
大型语言模型(LLM)虽然流畅,却容易产生幻觉,生成的答案看似合理却不受可用证据的支持。在决策必须由可验证信息支撑的高风险领域中,这一失效尤为棘手。我们引入EvidenceRL,这是一个强化学习框架,用于在训练期间强制执行证据遵循性。EvidenceRL对候选响应进行评分,评估其依据性(与检索证据和上下文的蕴涵关系)和正确性(与参考答案的一致性),并使用Group Relative Policy Optimization(GRPO)对生成器进行优化。在两个高风险领域中进行评估,心血管诊断和法律推理,EvidenceRL在证据依据性和忠实性方面均表现出一致的改进,同时未牺牲任务准确性。在心血管诊断领域,F1@3从37.0提升至54.5,证据依据性()从47.6提升至78.2;幻觉几乎降低了5倍,基于证据的诊断比例从31.8%提升至61.6%。在法律推理中,EvidenceRL将忠实性从32.8%提升至67.6%,在Llama-3.1-8B模型上显示出在不同领域中行为的一致性变化。我们的代码已开源于https://github.com/Wizaaard/EvidenceRL.git。
引用
@article{arxiv.2603.19532,
title = {EvidenceRL: Reinforcing Evidence Consistency for Trustworthy Language Models},
author = {J. Ben Tamo and Yuxing Lu and Benoit L. Marteau and Micky C. Nnamdi and May D. Wang},
journal= {arXiv preprint arXiv:2603.19532},
year = {2026}
}