WaveMix:面向图像的资源高效令牌混合架构
计算机视觉与模式识别
2022-03-09 v1 人工智能
机器学习
摘要
尽管某些视觉Transformer(ViT)和CNN架构在视觉任务上泛化良好,但由于其训练乃至测试的计算需求,在绿色、边缘或桌面计算中常难以实用。我们提出WaveMix作为一种替代性神经架构,其使用多尺度二维离散小波变换(DWT)进行空间令牌混合。与ViT不同,WaveMix既不展开图像,也不需要二次复杂度的自注意力。此外,除卷积滤波外,DWT引入了另一种归纳偏置——利用图像的二维结构以改善泛化。与CNN相比,DWT的多尺度特性降低了对更深架构的需求,因为后者依赖池化进行局部空间混合。WaveMix模型在多个数据集上展现出与ViT、CNN及令牌混合器相竞争的泛化能力,同时需要更低的GPU显存(训练与测试)、计算量和存储。WaveMix在EMNIST Byclass和EMNIST Balanced数据集上取得了当前最优(SOTA)结果。
引用
@article{arxiv.2203.03689,
title = {WaveMix: Resource-efficient Token Mixing for Images},
author = {Pranav Jeevan and Amit Sethi},
journal= {arXiv preprint arXiv:2203.03689},
year = {2022}
}
备注
12 pages, 2 figures