缩小视觉 Transformer 与卷积神经网络在小数据集上的性能差距
计算机视觉与模式识别
2023-01-02 v2 机器学习
摘要
在小数据集上从头训练时,视觉 Transformer(ViTs)与卷积神经网络(CNNs)之间仍存在极大的性能差距,这被归结为归纳偏置的缺乏。本文进一步考量该问题并指出 ViTs 在归纳偏置上的两点薄弱之处,即空间相关性与多样通道表示。首先,在空间方面,物体是局部紧凑且相关的,因此需要从某一 token 及其邻域中提取细粒度特征,而数据缺乏阻碍了 ViTs 关注空间相关性。其次,在通道方面,表示在不同通道上呈现多样性,但稀缺数据无法使 ViTs 学到足够强的表示以准确识别。为此,我们提出动态混合视觉 Transformer(DHVT)作为增强这两种归纳偏置的方案。在空间方面,我们采用混合结构,将卷积集成至 patch 嵌入与多层感知机模块,迫使模型捕获 token 特征及其邻域特征。在通道方面,我们在 MLP 中引入动态特征聚合模块,并在多头自注意力模块中提出全新的“head token”设计,以重新校准通道表示并促使不同通道组表示相互交互。弱通道表示的融合形成足够强的分类表示。借助该设计,我们成功消除了 CNNs 与 ViTs 间的性能差距,且我们的 DHVT 以轻量模型取得一系列最优性能:在 CIFAR-100 上以 22.8M 参数达 85.68%,在 ImageNet-1K 上以 24.0M 参数达 82.3%。代码见 https://github.com/ArieSeirack/DHVT。
引用
@article{arxiv.2210.05958,
title = {Bridging the Gap Between Vision Transformers and Convolutional Neural Networks on Small Datasets},
author = {Zhiying Lu and Hongtao Xie and Chuanbin Liu and Yongdong Zhang},
journal= {arXiv preprint arXiv:2210.05958},
year = {2023}
}
备注
Fix the bug when calculating FLOPs of the models