中文

通过事实性感知偏好学习降低大语言模型中的幻觉现象

计算与语言 2026-04-16 v3

摘要

偏好对齐方法,如RLHF和直接偏好优化(DPO),可改善指令遵循,但当偏好判断以流畅性和自信度为导向而非事实正确性时,也会强化幻觉。我们引入F-DPO(事实性感知直接偏好优化),是DPO的一个简单扩展,仅使用二元事实性标签。F-DPO(1)应用标签翻转变换,纠正误排序的偏好对,使被选取的响应永远不比被拒绝的响应less事实性;(2)添加事实性感知边际,强调具有明确正确性差异的配对,同时在两个响应事实性相同时简化为标准DPO。我们通过为DPO配对增添二元事实性指示器并生成合成幻觉变体来构建事实性感知偏好数据。对于七个开源大语言模型(1B-14B),F-DPO在事实性和幻觉率方面均优于基线模型和标准DPO。在Qwen3-8B上,F-DPO将幻觉率降低5倍(从0.424降至0.084),并提升事实性得分50%(从5.26升至7.90)。F-DPO也适用于超出分布基准:在TruthfulQA上,Qwen2.5-14B实现MC1准确率提升17%(0.500至0.585),MC2准确率提升49%(0.357至0.531)。F-DPO无需辅助奖励模型、token级标注或多阶段训练。

关键词

引用

@article{arxiv.2601.03027,
  title  = {Reducing Hallucinations in LLMs via Factuality-Aware Preference Learning},
  author = {Sindhuja Chaduvula and Ahmed Y. Radwan and Azib Farooq and Yani Ioannou and Shaina Raza},
  journal= {arXiv preprint arXiv:2601.03027},
  year   = {2026}
}