基于 Vision Transformer 的对抗性域适应
计算机视觉与模式识别
2024-04-25 v1 机器学习
摘要
无监督域适应 (UDA) 旨在将来自标记源域的知识传递到未标记的目标域。最新的 UDA 方法总是依赖对抗训练以取得最先进的效果,而大量现有 UDA 方法使用卷积神经网络 (CNN) 作为特征提取器以学习域不变特征。自出现以来,Vision Transformer (ViT) 已引起巨大关注,并在各种计算机视觉任务中得到广泛应用,如图像分类、目标检测和语义分割,但其在对抗性域适应中的潜力从未被调查。本文填补了这一空白,通过在对抗性域适应中采用 ViT 作为特征提取器。此外,我们经验性地表明 ViT 可作为对抗性域适应的即插即用组件,这意味着直接替换现有 UDA 方法中的基于 CNN 的特征提取器为基于 ViT 的特征提取器即可轻松获得性能提升。代码已提供:https://github.com/LluckyYH/VT-ADA。
引用
@article{arxiv.2404.15817,
title = {Vision Transformer-based Adversarial Domain Adaptation},
author = {Yahan Li and Yuan Wu},
journal= {arXiv preprint arXiv:2404.15817},
year = {2024}
}
备注
6 pages