中文

优先处理图像相关标记提升视觉语言预训练

计算机视觉与模式识别 2025-05-15 v1 计算与语言 机器学习

摘要

在标准的大型视觉语言模型(LVM)预训练中,模型通常通过下一个标记预测(NTP)最大化图像条件下描述的联合概率;然而,由于只有极小比例的描述标记直接关联视觉内容,这种朴素的NTP无意中使模型拟合噪声,增加了幻觉风险。我们提出PRIOR,一种简单的视觉语言预训练方法,通过在NTP损失中对图像相关标记进行差分加权,以此解决上述问题,借鉴importance sampling框架。PRIOR引入一个参考模型——在无图像输入的描述上训练的文本-only大型语言模型(LLM),依据其为LVM训练预测每个标记的概率来加权每个标记。直观地说,与视觉输入直接相关的标记在没有图像的情况下难以预测,因此来自文本-only参考LLM的概率较低。在训练期间,我们根据importance得分实施基于标记的再加权项,以调整每个标记的损失。我们在两种不同设置下实现PRIOR:具有视觉编码器的LVM和没有视觉编码器的LVM。我们观察到在几个视觉语言基准测试中,分别实现了19%和8%的平均相对提升。此外,PRIOR表现出优异的扩展特性,显著的更高扩展系数表明在计算和数据增加的情况下,与NTP相比,PRIOR的性能提升潜力更大。

关键词

引用

@article{arxiv.2505.08971,
  title  = {Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training},
  author = {Yangyi Chen and Hao Peng and Tong Zhang and Heng Ji},
  journal= {arXiv preprint arXiv:2505.08971},
  year   = {2025}
}

备注

The code will be available at https://github.com/Yangyi-Chen/PRIOR