MIA-DPO: 面向大型视觉语言模型的多图像增强直接偏好优化
计算机视觉与模式识别
2024-10-24 v1 人工智能
摘要
视觉偏好对齐涉及训练大型视觉语言模型(LVLMs)来预测人类在视觉输入之间的偏好。这通常通过使用标记的选定/拒绝对数据集并采用直接偏好优化(DPO)等优化算法来实现。现有的视觉对齐方法主要针对单图像场景设计,由于多样化训练数据的稀缺以及标注选定/拒绝对的高昂成本,难以有效处理多图像任务的复杂性。我们提出了多图像增强直接偏好优化(MIA-DPO),这是一种能够有效处理多图像输入的视觉偏好对齐方法。MIA-DPO通过将单图像数据与以网格拼贴或画中画格式排列的不相关图像进行扩展,从而缓解了多样化多图像训练数据的稀缺问题,显著降低了与多图像数据标注相关的成本。我们的观察表明,LVLMs的注意力值在不同图像之间差异很大。我们利用注意力值来识别并过滤掉模型可能错误关注的拒绝响应。我们的注意力感知选择用于构建选定/拒绝对,无需依赖(i)人工标注、(ii)额外数据和(iii)外部模型或API。MIA-DPO兼容多种架构,并在五个多图像基准测试中优于现有方法,在LLaVA-v1.5上平均性能提升3.0%,在最新的InternLM-XC2.5上平均性能提升4.3%。此外,MIA-DPO对模型理解单图像的能力影响极小。
引用
@article{arxiv.2410.17637,
title = {MIA-DPO: Multi-Image Augmented Direct Preference Optimization For Large Vision-Language Models},
author = {Ziyu Liu and Yuhang Zang and Xiaoyi Dong and Pan Zhang and Yuhang Cao and Haodong Duan and Conghui He and Yuanjun Xiong and Dahua Lin and Jiaqi Wang},
journal= {arXiv preprint arXiv:2410.17637},
year = {2024}
}
备注
Project URL: https://github.com/Liuziyu77/MIA-DPO