中文

域适应与域泛化中的视觉Transformer:鲁棒性研究

计算机视觉与模式识别 2024-10-17 v2 人工智能

摘要

深度学习模型通常在数据分布与训练和验证阶段不同的场景下进行评估。这种差异对准确预测模型在目标分布上部署后的性能提出了挑战。域适应和域泛化被广泛认为是应对这种偏移、确保可靠性能的有效策略。最近视觉Transformer在计算机视觉任务中取得的令人鼓舞的结果,以及自注意力机制的进步,证明了它们在处理分布偏移方面具有显著的鲁棒性和泛化潜力。受研究界日益增长的兴趣驱动,本文研究了视觉Transformer在域适应和域泛化场景中的部署。对于域适应方法,我们将研究分为特征级、实例级、模型级适应和混合方法,以及其他关于增强域适应的不同策略的分类。类似地,对于域泛化,我们将研究分为多域学习、元学习、正则化技术和数据增强策略。我们进一步对研究中的不同策略进行分类,强调了研究人员通过集成视觉Transformer来解决分布偏移所采取的各种方法。包含总结这些类别的综合表格是我们工作的一个显著特征,为研究人员提供了宝贵的见解。这些发现突出了视觉Transformer在处理分布偏移方面的多功能性,这对于实际应用(尤其是在关键安全和决策场景中)至关重要。

关键词

引用

@article{arxiv.2404.04452,
  title  = {Vision transformers in domain adaptation and domain generalization: a study of robustness},
  author = {Shadi Alijani and Jamil Fayyad and Homayoun Najjaran},
  journal= {arXiv preprint arXiv:2404.04452},
  year   = {2024}
}