V-DPO:通过视觉引导的直接偏好优化缓解大视觉语言模型中的幻觉
计算机视觉与模式识别
2024-11-06 v1 人工智能
摘要
大视觉语言模型(LVLMs)存在幻觉问题,导致输出文本响应与输入视觉内容之间出现错位。近期研究表明,对大语言模型(LLM)骨干网络的过度依赖是LVLM幻觉的原因之一,其固有引入了语言先验偏差,导致对视觉输入的语境注意力不足。我们通过偏好学习缓解这种过度依赖来解决幻觉问题。我们提出了视觉引导的直接偏好优化(Vision-guided Direct Preference Optimization, V-DPO),以在训练时增强视觉语境学习。为了解释V-DPO在不同类型训练数据上的有效性和泛化性,我们构建了一个包含响应对比偏好对和图像对比偏好对的合成数据集,并与现有的人工标注幻觉样本进行了对比。我们的方法在各种幻觉基准上相比基线方法取得了显著提升。我们的分析表明,V-DPO在图像对比偏好数据上表现优异,展示了其激发和理解视觉语境细微差别的卓越能力。我们的代码公开发布于 https://github.com/YuxiXie/V-DPO。
引用
@article{arxiv.2411.02712,
title = {V-DPO: Mitigating Hallucination in Large Vision Language Models via Vision-Guided Direct Preference Optimization},
author = {Yuxi Xie and Guanzhen Li and Xiao Xu and Min-Yen Kan},
journal= {arXiv preprint arXiv:2411.02712},
year = {2024}
}
备注
EMNLP 2024 Findings; 9 pages, 6 figures, 5 tables (16 pages, 8 figures, 8 tables including references and appendices)