中文

面向增强多模态理解能力的指令导向偏好对齐

计算机视觉与模式识别 2025-09-08 v2

摘要

偏好对齐已成为提高多模态大语言模型(MLLMs)性能的有效策略,通常在监督微调后实现。然而,现有偏好对齐方法主要针对幻觉因素,忽视了多模态理解能力所必需的因素,往往仅限于改善幻觉防御。为弥合这一差距,我们提出指令导向偏好对齐(IPA),一种可自动构建基于指令完成效能的对齐偏好的可扩展框架。我们的方法包括自动化偏好构建和专门的验证过程,以识别指令导向因素,避免响应表示中的显著变异。此外,IPA包含渐进式偏好收集管道,通过模型自演化和参考引导的细化进一步召回具有挑战性的样本。在Qwen2VL-7B上进行的实验表明,IPA在多个基准测试中有效,包括幻觉评估、视觉问答和文本理解任务,凸显了其提升通用理解能力的潜力。

关键词

引用

@article{arxiv.2503.20309,
  title  = {Instruction-Oriented Preference Alignment for Enhancing Multi-Modal Comprehension Capability of MLLMs},
  author = {Zitian Wang and Yue Liao and Kang Rong and Fengyun Rao and Yibo Yang and Si Liu},
  journal= {arXiv preprint arXiv:2503.20309},
  year   = {2025}
}

备注

Accepted by ICCV 2025