聚焦于视觉关怀:基于视觉信息增益的大型视觉语言模型选择性训练
计算机视觉与模式识别
2026-05-22 v2
摘要
大型视觉语言模型(LVLMs)取得了显著进展,但常常受语言偏见影响,产生不依赖视觉证据的答案。虽然先前工作通过解码策略、架构修改或精选指令数据试图缓解此问题,但通常缺乏对单个训练样本或标记实际从图像中获益的定量度量。本文引入视觉信息增益(VIG),一种基于困惑度的指标,衡量视觉输入对预测不确定性降低的程度。VIG实现了样本和标记层面的细粒度分析,有效地突出了视觉锚定元素,如颜色、空间关系和属性。基于此,我们提出了VIG引导的选择性训练方案,优先处理高VIG样本和标记。该方法改进了视觉锚定,缓解了语言偏见,在显著减少监督的同时实现了优异性能,专注于仅视觉信息丰富的样本和标记。
引用
@article{arxiv.2602.17186,
title = {Focusing Where Vision Matters: Selective Training for Large Vision Language Models via Visual Information Gain},
author = {Seulbi Lee and Sangheum Hwang},
journal= {arXiv preprint arXiv:2602.17186},
year = {2026}
}
备注
Accepted at ICML 2026