TVT:用于无监督域适应的可迁移视觉 Transformer
计算机视觉与模式识别
2021-11-29 v2
摘要
无监督域适应(UDA)旨在将已标注源域中学到的知识迁移到未标注目标域。先前的工作主要基于卷积神经网络(CNN)来学习域不变表示。随着近年来 Vision Transformer(ViT)在视觉任务中应用的指数级增长,ViT 在跨域知识适应方面的能力却仍未被文献探索。为填补这一空白,本文首先全面研究了 ViT 在多种域适应任务上的可迁移性。令人惊讶的是,ViT 展现出远超基于 CNN 对应方法的可迁移性,且通过引入对抗适应可进一步提升性能。然而,直接套用基于 CNN 的适应策略未能利用 ViT 的内在优势(如注意力机制与序列图像表示),而这些优势在知识迁移中起着重要作用。为此,我们提出了一个统一框架,即可迁移视觉 Transformer(TVT),以充分挖掘 ViT 在域适应中的可迁移性。具体而言,我们精心设计了称为可迁移性适应模块(TAM)的新型有效单元。通过将学习到的可迁移性注入注意力块,TAM 迫使 ViT 同时关注可迁移且具有判别性的特征。此外,我们利用判别聚类来增强在对抗域对齐过程中被削弱的特征多样性与可分性。为验证其通用性,我们在四个基准上进行了 TVT 的广泛实验,结果表明 TVT 相比现有最优 UDA 方法取得了显著提升。
引用
@article{arxiv.2108.05988,
title = {TVT: Transferable Vision Transformer for Unsupervised Domain Adaptation},
author = {Jinyu Yang and Jingjing Liu and Ning Xu and Junzhou Huang},
journal= {arXiv preprint arXiv:2108.05988},
year = {2021}
}
备注
Code: https://github.com/uta-smile/TVT