中文

SwimVG:用于视觉定位的逐步多模态融合与适配

计算机视觉与模式识别 2025-03-03 v2

摘要

视觉定位旨在通过自然语言定位图像区域,这严重依赖于跨模态对齐。现有大多数方法通过完全微调单模态预训练模型来分别迁移视觉/语言知识,随后通过简单的视觉语言 Transformer 堆叠进行多模态融合。然而,这些方法不仅限制了视觉与语言上下文之间的充分交互,还带来了显著的计算开销。因此,为了解决这些问题,我们探索了一种逐步多模态融合与适配框架,即 SwimVG。具体而言,SwimVG 提出了逐步多模态提示(Swip)和跨模态交互适配器(CIA)用于视觉定位,取代了用于多模态融合的繁琐 Transformer 堆叠。Swip 能够以 token 级融合的方式,逐步改善视觉与语言表示之间的对齐。此外,权重级 CIA 通过跨模态交互进一步促进多模态融合。Swip 和 CIA 都是参数高效的范式,它们从浅层到深层逐渐融合跨模态特征。在四个广泛使用的基准上的实验结果表明,SwimVG 在效率方面展现出卓越的能力和可观的收益。我们的代码可在 https://github.com/liuting20/SwimVG 获取。

关键词

引用

@article{arxiv.2502.16786,
  title  = {SwimVG: Step-wise Multimodal Fusion and Adaption for Visual Grounding},
  author = {Liangtao Shi and Ting Liu and Xiantao Hu and Yue Hu and Quanjun Yin and Richang Hong},
  journal= {arXiv preprint arXiv:2502.16786},
  year   = {2025}
}

备注

12 pages, 7 figures