中文

从上下文到线索的聚焦:多图像MLLM的分层偏好优化

计算机视觉与模式识别 2025-05-29 v1

摘要

多模态大语言模型(MLLM)在单图像任务上表现出色,但由于跨模态错位,在多图像理解上存在困难,导致幻觉(上下文遗漏、混淆和误解)。使用直接偏好优化(DPO)的现有方法将优化限制在输入序列中的单一图像参考内,忽略了整体上下文建模。我们提出从上下文到线索的直接偏好优化,这是一种多级偏好优化框架,通过聚焦视觉线索——从序列上下文到局部细节——来增强多图像设置中的单图像感知。其特点包括:(i) 上下文级优化:重新评估MLLM多图像上下文理解背后的认知偏差,并整合一系列低成本的全局序列偏好以缓解偏差。(ii) 细粒度级优化:通过区域靶向视觉提示和多模态偏好监督,将注意力引向细粒度视觉细节。为支持可扩展优化,我们还构建了MultiScope-42k,一个自动生成的、包含高质量多级偏好对的数据集。实验表明,CcDPO显著减少了幻觉,并在一般单图像和多图像任务上均取得了一致的性能提升。

关键词

引用

@article{arxiv.2505.22396,
  title  = {Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs},
  author = {Xudong Li and Mengdan Zhang and Peixian Chen and Xiawu Zheng and Yan Zhang and Jingyuan Zheng and Yunhang Shen and Ke Li and Chaoyou Fu and Xing Sun and Rongrong Ji},
  journal= {arXiv preprint arXiv:2505.22396},
  year   = {2025}
}