通过测试时类条件特征对齐无需从头重训练即可鲁棒化视觉 Transformer
计算机视觉与模式识别
2022-06-29 v1 人工智能
机器学习
摘要
Vision Transformer (ViT) 在图像处理中正变得愈发流行。具体而言,我们研究了测试时自适应(TTA)在 ViT 上的有效性,这是一种通过在测试时自行纠正其预测而涌现的技术。首先,我们在 ViT-B16 和 ViT-L16 上对各种测试时自适应方法进行了基准测试。结果表明 TTA 在 ViT 上是有效的,并且当使用适当的损失函数时,先前的惯例(明智地选择调制参数)并非必要。基于该观察,我们提出了一种名为类条件特征对齐(CFA)的新测试时自适应方法,它以在线方式最小化源域与目标域之间隐藏表示的类条件分布差异和整体分布差异。在常见 corruption(CIFAR-10-C、CIFAR-100-C 和 ImageNet-C)和域自适应(数字数据集和 ImageNet-Sketch)上的图像分类任务实验表明,CFA 在各种数据集上稳定优于现有基线。我们还通过在 ResNet、MLP-Mixer 以及若干 ViT 变体(ViT-AugReg、DeiT 和 BeiT)上实验验证了 CFA 是模型无关的。使用 BeiT 骨干网络,CFA 在 ImageNet-C 上达到了 19.8% 的 top-1 错误率,优于现有测试时自适应基线 44.0%。这是在不需改变训练阶段的 TTA 方法中的最先进水平结果。
引用
@article{arxiv.2206.13951,
title = {Robustifying Vision Transformer without Retraining from Scratch by Test-Time Class-Conditional Feature Alignment},
author = {Takeshi Kojima and Yutaka Matsuo and Yusuke Iwasawa},
journal= {arXiv preprint arXiv:2206.13951},
year = {2022}
}
备注
Accepted to IJCAI-ECAI2022. Code is available at https://github.com/kojima-takeshi188/CFA