面向增强多模态理解能力的指令导向偏好对齐
计算机视觉与模式识别
2025-09-08 v2
摘要
偏好对齐已成为提高多模态大语言模型(MLLMs)性能的有效策略,通常在监督微调后实现。然而,现有偏好对齐方法主要针对幻觉因素,忽视了多模态理解能力所必需的因素,往往仅限于改善幻觉防御。为弥合这一差距,我们提出指令导向偏好对齐(IPA),一种可自动构建基于指令完成效能的对齐偏好的可扩展框架。我们的方法包括自动化偏好构建和专门的验证过程,以识别指令导向因素,避免响应表示中的显著变异。此外,IPA包含渐进式偏好收集管道,通过模型自演化和参考引导的细化进一步召回具有挑战性的样本。在Qwen2VL-7B上进行的实验表明,IPA在多个基准测试中有效,包括幻觉评估、视觉问答和文本理解任务,凸显了其提升通用理解能力的潜力。
引用
@article{arxiv.2503.20309,
title = {Instruction-Oriented Preference Alignment for Enhancing Multi-Modal Comprehension Capability of MLLMs},
author = {Zitian Wang and Yue Liao and Kang Rong and Fengyun Rao and Yibo Yang and Si Liu},
journal= {arXiv preprint arXiv:2503.20309},
year = {2025}
}
备注
Accepted by ICCV 2025