中文

TFS-ViT:面向域泛化的令牌级特征风格化

计算机视觉与模式识别 2024-03-19 v3

摘要

卷积神经网络(CNN)等标准深度学习模型缺乏泛化到训练期间未见过域的能力。该问题主要源于此类模型常见但往往错误的同分布假设,即源域和目标数据来自相同的独立同分布(i.i.d.)分布。近来,视觉Transformer(ViT)在广泛的计算机视觉任务中展现出卓越性能。然而,极少有研究考察其泛化到新域的能力。本文提出一种用于域泛化的令牌级特征风格化(TFS-ViT)方法,通过合成新域来提升ViT对未知数据的性能。我们的方法通过混合来自不同域图像的归一化统计量来变换令牌特征。我们进一步提出一种注意力感知风格化新策略来改进该方法,其利用类(CLS)令牌的注意力图计算并混合对应于不同图像区域的令牌归一化统计量。所提方法对骨干模型的选择具有灵活性,可轻松应用于任何基于ViT的架构,且计算复杂度增加可忽略。综合实验表明,我们的方法在五个具有挑战性的域泛化基准上取得了最先进的性能,并展示了其处理不同类型域偏移的能力。实现代码见:https://github.com/Mehrdad-Noori/TFS-ViT_Token-level_Feature_Stylization。

关键词

引用

@article{arxiv.2303.15698,
  title  = {TFS-ViT: Token-Level Feature Stylization for Domain Generalization},
  author = {Mehrdad Noori and Milad Cheraghalikhani and Ali Bahri and Gustavo A. Vargas Hakim and David Osowiechi and Ismail Ben Ayed and Christian Desrosiers},
  journal= {arXiv preprint arXiv:2303.15698},
  year   = {2024}
}