CLIP-DPO:利用视觉语言模型作为偏好来源以修复大视觉语言模型中的幻觉
计算机视觉与模式识别
2024-08-21 v1
摘要
尽管取得了近期成功,大视觉语言模型(LVLMs)仍容易产生关于物体及其属性或关系的细节幻觉,限制了其在现实世界中的部署。为解决这一问题并提高其鲁棒性,我们提出了 CLIP-DPO,一种利用对比预训练的视觉语言(VL)嵌入模型(如 CLIP)进行基于 DPO 的 LVLM 优化的偏好优化方法。与先前处理 LVLM 幻觉的工作不同,我们的方法不依赖付费 API,也不需要额外的训练数据或其他外部 LVLMs 的部署。相反,从监督微调的初始数据池出发,我们生成一组多样化的预测,根据其 CLIP 图像-文本相似度进行排序,然后通过鲁棒的基于规则的过滤方法获得用于 DPO 训练的正负样本对。我们将 CLIP-DPO 微调应用于 MobileVLM-v2 系列模型和 LLaVA-1.5,在所有情况下均观察到相对于基线模型在幻觉减少方面的显著改善。我们还观察到零样本分类性能的提升,表明 grounding 能力得到改善,并验证了在标准 LVLM 基准测试上的原始性能总体上得以保持。
引用
@article{arxiv.2408.10433,
title = {CLIP-DPO: Vision-Language Models as a Source of Preference for Fixing Hallucinations in LVLMs},
author = {Yassine Ouali and Adrian Bulat and Brais Martinez and Georgios Tzimiropoulos},
journal= {arXiv preprint arXiv:2408.10433},
year = {2024}
}
备注
Accepted at ECCV 2024