中文

用于域泛化的提示视觉Transformer

计算机视觉与模式识别 2022-08-19 v1

摘要

尽管视觉Transformer(ViT)已展现出令人印象深刻的表征学习能力,但我们通过实验发现,借助以往的域泛化算法,它们不能很好地泛化到未见域。本文提出一种基于提示学习的新方法 DoPrompt,将源域知识嵌入域提示中用于目标域预测。具体而言,域提示被添加在来自对应源域的 ViT 输入词元之前。每个域提示仅针对单一域优化,因而高效地学习域特定知识。同时,我们训练一个提示适配器,基于已学习的源域提示为每张输入图像生成合适的提示。在测试时,由提示适配器生成的适配提示可利用域外图像特征与源域之间的相似性,恰当地整合源域知识。我们在四个基准数据集上进行了充分实验。我们的方法在平均准确率上取得了 1.4% 的提升,这是基于 ViT 骨干的最先进算法提升量的 3.5 倍。

关键词

引用

@article{arxiv.2208.08914,
  title  = {Prompt Vision Transformer for Domain Generalization},
  author = {Zangwei Zheng and Xiangyu Yue and Kai Wang and Yang You},
  journal= {arXiv preprint arXiv:2208.08914},
  year   = {2022}
}