中文

利用域表示图像以视觉Transformer改进无源目标自适应

计算机视觉与模式识别 2023-12-05 v2 人工智能 机器学习

摘要

无监督域适应(UDA)方法促进知识从有标签源域向无标签目标域的迁移,以应对域偏移的障碍。尽管卷积神经网络(CNNs)是UDA中的主力,视觉Transformer(ViTs)的兴起为域泛化提供了新途径。本文提出一种在无源目标适应中增强ViT性能的革新方法,首先评估键、查询和值元素如何影响ViT结果。实验表明,改变键组件对Transformer性能影响可忽略。利用此发现,我们引入域表示图像(DRIs),通过键组件馈入嵌入。DRIs充当域特定标记,轻松融入训练流程。为评估我们的方法,我们在Cross Instance DRI仅源(SO)控制上执行目标适应测试。我们测量有和无DRIs时目标适应的效能,对比SHOT-B*等现有基准与通过CDTrans的适应。结果表明,不含DRIs相较SHOT-B*增益有限,而将其纳入键段提升了平均精度,促进更优的域泛化。本研究强调了DRIs在提升UDA场景中ViT效率的关键作用,为进一步的域适应探索树立先例。

关键词

引用

@article{arxiv.2311.12589,
  title  = {Improving Source-Free Target Adaptation with Vision Transformers Leveraging Domain Representation Images},
  author = {Gauransh Sawhney and Daksh Dave and Adeel Ahmed and Jiechao Gao and Khalid Saleem},
  journal= {arXiv preprint arXiv:2311.12589},
  year   = {2023}
}

备注

Requesting withdrawal due to significant overlap with prior research that wasn't appropriately acknowledged in our manuscript. The decision is made to uphold academic integrity