S2H-DPO:面向视觉语言模型的硬度感知偏好优化
计算机视觉与模式识别
2026-04-21 v1
摘要
视觉语言模型(VLMs)在单图像理解方面取得了显著进展,但在跨多图像的有效推理仍存在挑战。我们识别出现有多图像对齐方法存在的关键能力缺口:当前方法主要聚焦于预指定图像索引的局部推理(如“查看图像 3...”),绕过了全局视觉搜索和自主跨图像比较的关键技能。为此,我们引入一种简单到复杂(S2H)学习框架,系统性地构建三级推理层次的多图像偏好数据,要求逐级提升能力:(1)单图像局部推理,(2)多图像局部比较,(3)全局视觉搜索。不同于依赖模型特定属性(如幻觉或注意力启发式)生成偏好对的先前工作,本方法利用提示驱动的复杂度创建可适用于不同模型的选取/拒绝配对。通过对 LLaVA 和 Qwen-VL 模型的广泛评估,我们展示,多样化的多图像推理数据显著提升了多图像推理性能,在各类基准测试中均实现显著超越基线方法的改进。重要的是,本方法在保持强大的单图像推理性能的同时,显著提升了多图像理解能力,从而推动了整体视觉偏好对齐的技术进步。
引用
@article{arxiv.2604.18512,
title = {S2H-DPO: Hardness-Aware Preference Optimization for Vision-Language Models},
author = {Nitish Shukla and Surgan Jandial and Arun Ross},
journal= {arXiv preprint arXiv:2604.18512},
year = {2026}
}