中文

TIPSv2:通过增强 patch-text 对齐推进视觉语言预训练

计算机视觉与模式识别 2026-04-15 v1

摘要

近期视觉语言预训练的进展已为许多下游计算机视觉应用(如分类、检索、分割和深度预测)带来了显著改进。然而,这些模型仍难掌握的基本能力是将稠密 patch 表示与相应概念的文本嵌入对齐。本文调查了这一关键问题,提出了新技术来增强基础视觉语言模型中的此能力。首先,我们发现一种 patch 级别的蒸馏程序可显著提升稠密 patch-text 对齐——令人惊讶的是,蒸馏学生模型的 patch-text 对齐强度显著超过教师模型。这一观察启发我们考虑修改预训练配方,导致我们提出iBOT++,即对常用iBOT掩码图像目标的升级版,其中未掩码的 token 也直接贡献于损失。这显著提升了预训练模型的 patch-text 对齐。此外,为提高视觉语言预训练的效率和效果,我们修改了指数移动平均设置,并引入一种caption采样策略以从不同粒度的合成caption中受益。综合这些组件,我们开发了TIPSv2,一套适用于广泛下游应用的图像-文本编码器模型。通过在9个任务和20个数据集上的全面实验,我们展示了强大的性能,通常与或优于最新视觉编码器模型相当。代码和模型通过我们的项目页面 https://gdm-tipsv2.github.io/ 发布。

关键词

引用

@article{arxiv.2604.12012,
  title  = {TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment},
  author = {Bingyi Cao and Koert Chen and Kevis-Kokitsi Maninis and Kaifeng Chen and Arjun Karpur and Ye Xia and Sahil Dua and Tanmaya Dabral and Guangxing Han and Bohyung Han and Joshua Ainslie and Alex Bewley and Mithun Jacob and René Wagner and Washington Ramos and Krzysztof Choromanski and Mojtaba Seyedhosseini and Howard Zhou and André Araujo},
  journal= {arXiv preprint arXiv:2604.12012},
  year   = {2026}
}

备注

CVPR2026 camera-ready + appendix