SwimVG:用于视觉定位的逐步多模态融合与适配
计算机视觉与模式识别
2025-03-03 v2
摘要
视觉定位旨在通过自然语言定位图像区域,这严重依赖于跨模态对齐。现有大多数方法通过完全微调单模态预训练模型来分别迁移视觉/语言知识,随后通过简单的视觉语言 Transformer 堆叠进行多模态融合。然而,这些方法不仅限制了视觉与语言上下文之间的充分交互,还带来了显著的计算开销。因此,为了解决这些问题,我们探索了一种逐步多模态融合与适配框架,即 SwimVG。具体而言,SwimVG 提出了逐步多模态提示(Swip)和跨模态交互适配器(CIA)用于视觉定位,取代了用于多模态融合的繁琐 Transformer 堆叠。Swip 能够以 token 级融合的方式,逐步改善视觉与语言表示之间的对齐。此外,权重级 CIA 通过跨模态交互进一步促进多模态融合。Swip 和 CIA 都是参数高效的范式,它们从浅层到深层逐渐融合跨模态特征。在四个广泛使用的基准上的实验结果表明,SwimVG 在效率方面展现出卓越的能力和可观的收益。我们的代码可在 https://github.com/liuting20/SwimVG 获取。
引用
@article{arxiv.2502.16786,
title = {SwimVG: Step-wise Multimodal Fusion and Adaption for Visual Grounding},
author = {Liangtao Shi and Ting Liu and Xiantao Hu and Yue Hu and Quanjun Yin and Richang Hong},
journal= {arXiv preprint arXiv:2502.16786},
year = {2025}
}
备注
12 pages, 7 figures