SETA:用于领域泛化的语义感知 Token 增强
计算机视觉与模式识别
2024-10-22 v2
摘要
领域泛化(DG)旨在不访问目标领域的情况下增强模型对领域偏移的鲁棒性。DG 中的一类主流方法是数据增强,其侧重于生成虚拟样本以模拟领域偏移。然而,现有的 DG 增强技术主要针对卷积神经网络(CNN)设计,在基于 token 的架构,即 vision transformer(ViT)和多层感知机(MLP)模型中的探索有限。本文中,我们研究了现有基于 CNN 的增强方法对基于 token 的模型的影响,揭示其由于未能激励模型学习整体形状信息而导致性能欠佳。为解决此问题,我们提出了语义感知 Token 增强(SEmantic-aware Token Augmentation,SETA)方法。SETA 通过扰动局部边缘线索同时保留全局形状特征来转换 token 特征,从而增强模型对形状信息的学习。为进一步增强模型的泛化能力,我们引入了该方法的两种风格化变体,并结合了 DG 中两种 SOTA 风格增强方法。我们为该方法提供了理论见解,证明其在降低泛化风险界方面的有效性。在五个基准上的综合实验证明,我们的方法在各种 ViT 和 MLP 架构上均取得了 SOTA 性能。代码可在 https://github.com/lingeringlight/SETA 获取。
引用
@article{arxiv.2403.11792,
title = {SETA: Semantic-Aware Token Augmentation for Domain Generalization},
author = {Jintao Guo and Lei Qi and Yinghuan Shi and Yang Gao},
journal= {arXiv preprint arXiv:2403.11792},
year = {2024}
}
备注
Accepted by IEEE TIP 2024. The code is available at https://github.com/lingeringlight/SETA