中文

跨模态多模式词元级提示对齐调优

计算机视觉与模式识别 2023-10-27 v2

摘要

视觉-语言模型提示调优的进展已凸显其在增强开放世界视觉概念理解方面的潜力。然而,先前工作主要聚焦于单模式(每模态仅一个提示)与整体级(图像或句子)语义对齐,未能捕捉样本多样性,导致次优提示发现。为应对该局限,我们提出一种多模式词元级调优框架,利用最优传输跨模态学习并对齐一组提示词元。具体而言,我们依赖两个关键要素:1)多模式提示发现,保障多样化语义表示;2)词元级对齐,助力探索细粒度相似性。因此,相似性可计算为模态特定集合间的分层传输问题。在流行图像识别基准上的大量实验展示了我们方法的优越泛化与少样本能力。定性分析表明,所学提示词元具备捕捉多样视觉概念的能力。

关键词

引用

@article{arxiv.2309.13847,
  title  = {Tuning Multi-mode Token-level Prompt Alignment across Modalities},
  author = {Dongsheng Wang and Miaoge Li and Xinyang Liu and MingSheng Xu and Bo Chen and Hanwang Zhang},
  journal= {arXiv preprint arXiv:2309.13847},
  year   = {2023}
}

备注

In Proceedings of NeurIPS2023