中文

面向长篇问答的原子一致性偏好优化

计算与语言 2025-11-11 v2

摘要

大型语言模型(LLM)常产生事实性幻觉——看似合理却不正确的答案。常见的缓解策略是模型对齐,通过在事实性(非事实性)配对对上进行训练来提高事实准确性。然而,这种方法常依赖更强大的模型(如 GPT-4)或外部知识库来评估事实正确性,而这些资源可能并不总是可用。针对这一问题,我们提出了原子一致性偏好优化(Atomic Consistency Preference Optimization, ACPO),一种无需外部监督的自监督偏好调优方法,以提升事实准确性。ACPO 利用原子一致性信号(即来自多个随机响应中 individual facts 之间的一致性)来识别高质量和低质量的数据配对,用于模型对齐。尽管是完全自监督的,ACPO 在 Phi-3 和 Llama3 上分别在 LongFact 和 BioGen 数据集上均优于强大的监督对齐基线 1.95 分,展示了在不依赖外部模型或知识库的情况下提升事实可靠性的有效性。

关键词

引用

@article{arxiv.2505.09039,
  title  = {Atomic Consistency Preference Optimization for Long-Form Question Answering},
  author = {Jingfeng Chen and Raghuveer Thirukovalluru and Junlin Wang and Kaiwei Luo and Bhuwan Dhingra},
  journal= {arXiv preprint arXiv:2505.09039},
  year   = {2025}
}

备注

13 pages, 1 figure