中文

面向持续视觉-语言检索的低秩提示交互

计算机视觉与模式识别 2025-01-27 v1

摘要

针对多模态任务的持续学习研究正受到越来越多的关注。然而,大多数现有工作忽略了显式的跨模态和跨任务交互。在本文中,我们创新性地提出了低秩提示交互 (LPI) 以解决多模态理解的通用问题,该方法同时考虑跨模态和跨任务交互。具体而言,针对前者,我们采用相应的 Transformer 层的多模态关联模块。鉴于训练参数随层数和任务数的增长,我们提出了低秩交互增强分解以避免内存爆炸,同时通过共享和分离 common-specific 低秩因子来增强跨模态关联。此外,由于低秩初始化承载多模态语义差异,我们采用层次低秩对比学习以确保训练的鲁棒性。针对后者,我们初步进行了视觉分析,发现不同任务在接近性方面存在明显区别。因此,我们在提示学习过程中引入显式任务对比约束,基于任务语义距离。在两个检索任务上的实验显示,我们的方法在引入最小数量的参数方面性能显著提升,表明了该方法的有效性。代码可在 https://github.com/Kelvin-ywc/LPI 上获取。

关键词

引用

@article{arxiv.2501.14369,
  title  = {Low-rank Prompt Interaction for Continual Vision-Language Retrieval},
  author = {Weicai Yan and Ye Wang and Wang Lin and Zirun Guo and Zhou Zhao and Tao Jin},
  journal= {arXiv preprint arXiv:2501.14369},
  year   = {2025}
}