Patch-Mix Transformer用于无监督域适应:一种博弈视角
计算机视觉与模式识别
2023-06-07 v2
摘要
近期人们致力于将视觉Transformer(ViT)用于具有挑战性的无监督域适应(UDA)任务。它们通常利用ViT中的交叉注意力进行直接域对齐。然而,由于交叉注意力的性能高度依赖于目标样本伪标签的质量,当域间差异较大时其效果变差。我们从博弈论视角使用提出的PMTrans模型解决了该问题,该模型以中间域桥接源域和目标域。具体地,我们提出一种称为PatchMix的新型基于ViT的模块,它通过基于博弈论模型从两域学习采样图像块来有效构建中间域(即概率分布)。如此,它学习混合源域和目标域的图像块以最大化交叉熵(CE),同时利用特征和标签空间中的两个半监督mixup损失来最小化它。据此,我们将UDA过程解释为包含特征提取器、分类器和PatchMix三方参与的最小化-最大化CE博弈,以寻找纳什均衡。此外,我们利用ViT的注意力图按每个图像块的重要性重新加权其标签,从而可能获得更具域判别性的特征表示。我们在四个基准数据集上进行了大量实验,结果表明PMTrans分别大幅超越基于ViT和CNN的SOTA方法:在Office-Home上+3.6%,在Office-31上+1.4%,在DomainNet上+17.7%。
引用
@article{arxiv.2303.13434,
title = {Patch-Mix Transformer for Unsupervised Domain Adaptation: A Game Perspective},
author = {Jinjing Zhu and Haotian Bai and Lin Wang},
journal= {arXiv preprint arXiv:2303.13434},
year = {2023}
}
备注
Accepted by CVPR 2023 (Highlight)