中文

深度耦合的跨模态提示学习

计算机视觉与模式识别 2023-12-07 v3

摘要

多模态基础模型(如 CLIP)近期的进展在零样本泛化方面表现出色。从基础模型向下游任务迁移知识中所涉及的提示微调近期受到显著关注。然而,跨模态学习中现有的提示微调方法要么仅关注语言分支,要么以浅层机制学习视觉-语言交互。在此背景下,我们提出一种基于 CLIP 的深度耦合跨模态提示学习(DCP)方法。DCP 通过跨模态提示注意力(CMPA)机制灵活适应视觉与语言之间的相互作用,该机制借助连接良好的多头注意力模块逐步且强有力地实现各自表示的相互交换。随后我们在 11 个图像分类数据集上进行了全面的少样本学习实验,并分析了其对域偏移的鲁棒性。充分的实验分析明显证明了良好实现的 DCP 具有优异的少样本泛化能力和引人注目的域适应能力。代码见 https://github.com/GingL/CMPA。

关键词

引用

@article{arxiv.2305.17903,
  title  = {Deeply Coupled Cross-Modal Prompt Learning},
  author = {Xuejing Liu and Wei Tang and Jinghui Lu and Rui Zhao and Zhaojun Guo and Fei Tan},
  journal= {arXiv preprint arXiv:2305.17903},
  year   = {2023}
}

备注

Accepted by ACL 2023 findings