中文

统一的视觉与语言提示学习

计算机视觉与模式识别 2022-10-14 v1 人工智能

摘要

提示微调(prompt tuning)是一种参数与数据高效的迁移学习范式,仅调整模型输入空间中的少量参数,自 CLIP 等大型视觉-语言模型出现以来已成为视觉界的趋势。我们对两种代表性提示微调方法——文本提示微调与视觉提示微调——进行了系统研究。一个主要发现是,单模态提示微调方法均无法始终表现良好:文本提示微调在具有较髙类内视觉方差的数据上失效,而视觉提示微调无法处理较低的类间方差。为兼取两者之长,我们提出一种称为统一提示微调(UPT)的简单方法,其本质上学习一个微小神经网络以跨不同模态联合优化提示。在超过 11 个视觉数据集上的大量实验表明,在少样本学习基准与域泛化基准上,UPT 均比单模态对应方法实现了更好的权衡。代码与模型将被发布以促进未来研究。

关键词

引用

@article{arxiv.2210.07225,
  title  = {Unified Vision and Language Prompt Learning},
  author = {Yuhang Zang and Wei Li and Kaiyang Zhou and Chen Huang and Chen Change Loy},
  journal= {arXiv preprint arXiv:2210.07225},
  year   = {2022}
}