中文

面向任务的视觉-语言模型多模态互学习

计算机视觉与模式识别 2023-03-31 v1

摘要

提示学习已成为将大型预训练视觉-语言模型适配下游任务的最高效范式之一。当前最先进的方法,如 CoOp 和 ProDA,倾向于采用软提示为每个特定任务学习合适的提示。近期的 CoCoOp 通过图像条件提示进一步提升了基类到新类的泛化性能。然而,如我们的实验所示,它直接将相同的图像语义融合到不同标签的提示中,显著削弱了不同类别间的判别性。受此观察启发,我们首先提出类感知文本提示(CTP)以用标签相关图像信息丰富生成的提示。与 CoCoOp 不同,CTP 能有效引入图像语义并避免向不同提示中引入额外歧义。另一方面,我们提出文本引导特征调优(TFT)以取代保留完整图像表示,使图像分支关注类相关表示。采用对比损失在下游任务上对齐此类增强的文本与图像表示。由此,图像到文本的 CTP 与文本到图像的 TFT 可相互促进,增强 VLM 对下游任务的适配。大量实验表明我们的方法以显著优势超越现有方法。尤其,与 CoCoOp 相比,我们在十一个分类基准上于新类取得 4.03% 的平均提升,于调和均值取得 3.19% 的平均提升。

关键词

引用

@article{arxiv.2303.17169,
  title  = {Task-Oriented Multi-Modal Mutual Leaning for Vision-Language Models},
  author = {Sifan Long and Zhen Zhao and Junkun Yuan and Zichang Tan and Jiangjiang Liu and Luping Zhou and Shengsheng Wang and Jingdong Wang},
  journal= {arXiv preprint arXiv:2303.17169},
  year   = {2023}
}