中文

Re-Align:通过检索增强的直接偏好优化对齐视觉语言模型

计算机视觉与模式识别 2025-09-23 v3 机器学习

摘要

大型视觉语言模型(VLMs)的出现通过整合视觉模态拓宽了单模态大语言模型(LLMs)的范围和能力,从而在各种现实场景中解锁了变革性的跨模态应用。尽管 VLMs 性能令人瞩目,但容易产生显著的幻觉,特别是以跨模态不一致的形式。基于人类反馈的强化学习(RLHF)在 LLMs 对齐方面的成功,近期的进展集中在精心策划的数据集上应用直接偏好优化(DPO)以缓解这些问题。然而,此类方法通常以粗暴的方式引入偏好信号,忽视了视觉信息在对齐过程中的关键作用。本文引入 Re-Align,一个新颖的对齐框架,利用图像检索构建双偏好数据集,有效整合文本和视觉偏好信号。我们进一步引入 rDPO,作为标准直接偏好优化的扩展,在微调期间纳入额外的视觉偏好目标。我们的实验结果表明,Re-Align 不仅比以前的方法更有效地缓解了幻觉,还在一般视觉问答(VQA)任务中产生了显著的性能提升。此外,我们表明 Re-Align 在广泛的 VLM 规模和架构中保持鲁棒性和可扩展性。这项工作代表了多模态 LLMs 对齐的重要一步,为更可靠和有效的跨模态应用铺平了道路。我们在 https://github.com/taco-group/Re-Align 发布了所有代码。

关键词

引用

@article{arxiv.2502.13146,
  title  = {Re-Align: Aligning Vision Language Models via Retrieval-Augmented Direct Preference Optimization},
  author = {Shuo Xing and Peiran Li and Yuping Wang and Ruizheng Bai and Yueqi Wang and Chan-Wei Hu and Chengxuan Qian and Huaxiu Yao and Zhengzhong Tu},
  journal= {arXiv preprint arXiv:2502.13146},
  year   = {2025}
}

备注

Published at EMNLP 2025