中文

面向视觉-语言模型的跨模态向后兼容表示学习

计算机视觉与模式识别 2025-10-07 v3 人工智能

摘要

现代检索系统在升级到新的更强大模型时常常遇到困难,因为新旧模型的嵌入不兼容。这需要一个称为回填的昂贵过程,涉及重新计算大量数据样本的嵌入。在视觉领域,已提出向后兼容训练(BT)以确保新模型与旧模型的嵌入对齐。本文将仅视觉BT的概念扩展到跨模态检索领域,标志着首次尝试解决跨模态BT(XBT)。我们的目标是实现视觉-语言预训练(VLP)模型(如CLIP)在跨模态检索任务中的向后兼容性。为了解决XBT挑战,我们提出了一种高效解决方案:一个将新模型嵌入映射到旧模型嵌入的投影模块。该模块仅使用文本数据进行预训练,显著减少了XBT学习所需的图像-文本对数量,并且一旦预训练完成,在训练期间避免使用旧模型。此外,我们利用参数高效训练策略,通过避免任何修改来提高效率并保留现成新模型的知识。跨模态检索数据集上的实验结果表明了XBT的有效性及其在出现新VLP模型时实现无回填升级的潜力。

关键词

引用

@article{arxiv.2405.14715,
  title  = {Towards Cross-modal Backward-compatible Representation Learning for Vision-Language Models},
  author = {Young Kyun Jang and Ser-nam Lim},
  journal= {arXiv preprint arXiv:2405.14715},
  year   = {2025}
}