中文

EUDA:通过自监督视觉Transformer实现高效无监督域适应

计算机视觉与模式识别 2024-08-01 v1 人工智能 机器学习

摘要

无监督域适应(UDA)旨在缓解域偏移问题,即训练数据(源域)的分布与测试数据(目标域)的分布不同。许多模型已被开发用于解决此问题,近期视觉Transformer(ViT)也展现出有前景的结果。然而,ViT的复杂性和大量可训练参数限制了其在实际应用中的部署。这凸显了对高效模型的需求,该模型不仅需要减少可训练参数,还需能根据特定需求调整复杂度,同时提供可比的性能。为此,本文提出了一种高效无监督域适应(EUDA)框架。EUDA采用自监督ViT模型DINOv2作为特征提取器,后接简化的全连接层瓶颈结构以精炼特征,增强域适应效果。此外,EUDA采用协同域对齐损失(SDAL),该损失融合了交叉熵(CE)损失和最大均值差异(MMD)损失,通过最小化源域的分类误差并对齐源域与目标域的分布来平衡适应。实验结果表明,EUDA在域适应任务中能以显著更少的可训练参数(减少42%至99.7%)产生与现有最先进方法可比的结果,展现了在资源受限环境中训练模型的能力。模型代码可在以下地址获取:https://github.com/A-Abedi/EUDA。

关键词

引用

@article{arxiv.2407.21311,
  title  = {EUDA: An Efficient Unsupervised Domain Adaptation via Self-Supervised Vision Transformer},
  author = {Ali Abedi and Q. M. Jonathan Wu and Ning Zhang and Farhad Pourpanah},
  journal= {arXiv preprint arXiv:2407.21311},
  year   = {2024}
}

备注

12 pages, 4 figures