中文

面向 LVLMs 幻觉缓解的自我纠正偏好学习——AVES-DPO 框架

人工智能 2026-04-28 v1

摘要

大型视觉语言模型(LVLMs)经常出现幻觉。现有的偏好学习方法大多依赖专有模型构建偏好数据集。我们识别到,这种依赖会导致专有模型与目标模型之间的分布性不匹配,阻碍高效对齐。为此,我们提出了 Alignment via VErified Self-correction DPO(AVES-DPO),一种利用模型内在知识从分布数据中对齐 LVLMs 的框架。我们的方法采用基于共识的验证机制来诊断多样化的幻觉,并指导模型自我纠正,从而生成严格符合其内部分布的偏好对。大量实验表明,AVES-DPO 在仅需 5.2k 样本的情况下超越了现有基线,在幻觉缓解方面表现更佳。

关键词

引用

@article{arxiv.2604.24395,
  title  = {Aligning with Your Own Voice: Self-Corrected Preference Learning for Hallucination Mitigation in LVLMs},
  author = {Byeonggeuk Lim and JungMin Yun and Junehyoung Kwon and Kyeonghyun Kim and YoungBin Kim},
  journal= {arXiv preprint arXiv:2604.24395},
  year   = {2026}
}

备注

Accepted to ACL 2026