对平移移位的泛化能力:架构与增强方法研究
计算机视觉与模式识别
2022-11-15 v2 机器学习
摘要
我们研究了数据增强在捕捉精心设计的网络空间平移不变性归纳偏置方面的有效性。我们评估了多种图像分类架构(抗混叠卷积、卷积、视觉 Transformer 与全连接 MLP 网络)以及数据增强技术对大幅平移移位泛化的表现。我们观察到:(a) 无数据增强时,所有架构(包括带抗混叠修改的卷积网络)在平移测试分布上评估时性能均有所退化。可以理解,非卷积模型的分布内准确率与对移位的退化程度均显著更差。(b) 即便仅对所有架构施加 4 像素随机裁剪的最小增强,性能鲁棒性亦得以提升。某些情况下,甚至 1–2 像素随机裁剪已足够。这表明增强存在一种元泛化形式。对于非卷积架构,尽管该基础增强下绝对准确率仍低,我们对平移移位的鲁棒性看到了实质性改善。(c) 借助充分先进的增强流程(4 像素裁剪+RandAugmentation+Erasing+MixUp),所有架构均可被训练至在分布内准确率以及对大幅平移移位的泛化上具备有竞争力的性能。
引用
@article{arxiv.2207.02349,
title = {Generalization to translation shifts: a study in architectures and augmentations},
author = {Suriya Gunasekar},
journal= {arXiv preprint arXiv:2207.02349},
year = {2022}
}