面向 LVLMs 幻觉缓解的自我纠正偏好学习——AVES-DPO 框架
人工智能
2026-04-28 v1
摘要
大型视觉语言模型(LVLMs)经常出现幻觉。现有的偏好学习方法大多依赖专有模型构建偏好数据集。我们识别到,这种依赖会导致专有模型与目标模型之间的分布性不匹配,阻碍高效对齐。为此,我们提出了 Alignment via VErified Self-correction DPO(AVES-DPO),一种利用模型内在知识从分布数据中对齐 LVLMs 的框架。我们的方法采用基于共识的验证机制来诊断多样化的幻觉,并指导模型自我纠正,从而生成严格符合其内部分布的偏好对。大量实验表明,AVES-DPO 在仅需 5.2k 样本的情况下超越了现有基线,在幻觉缓解方面表现更佳。
引用
@article{arxiv.2604.24395,
title = {Aligning with Your Own Voice: Self-Corrected Preference Learning for Hallucination Mitigation in LVLMs},
author = {Byeonggeuk Lim and JungMin Yun and Junehyoung Kwon and Kyeonghyun Kim and YoungBin Kim},
journal= {arXiv preprint arXiv:2604.24395},
year = {2026}
}
备注
Accepted to ACL 2026