MDMLP:基于 MLP 在小数据集上从零训练的图像分类
计算机视觉与模式识别
2022-05-31 v1 人工智能
摘要
注意力机制已成为自然语言处理与计算机视觉任务的首选技术。近来,仅基于多层感知机(MLP)的 MLP-Mixer 及其他基于 MLP 的架构,相较 CNN 与注意力技术同样强大,并开启了新的研究方向。然而,基于 MLP 的网络的高能力严重依赖大量训练数据,且相较 Vision Transformer (ViT) 或卷积网络缺乏可解释性。在小数据集上训练时,它们通常取得劣于卷积网络的结果。为此,我们提出(i)多维 MLP(MDMLP),一种概念简单且轻量的基于 MLP 的架构,却能在小尺寸数据集上从零训练取得 SOTA;(ii)多维 MLP 注意力工具(MDAttnTool),一种基于 MLP 的新型高效注意力机制。即便无强数据增强,MDMLP 在 CIFAR10 上以仅 0.3M 参数取得 90.90% 准确率,而知名 MLP-Mixer 以 17.1M 参数仅达 85.45%。此外,轻量 MDAttnTool 可高亮图像中物体,表明其具备解释能力。我们的代码见 https://github.com/Amoza-Theodore/MDMLP。
引用
@article{arxiv.2205.14477,
title = {MDMLP: Image Classification from Scratch on Small Datasets with MLP},
author = {Tian Lv and Chongyang Bai and Chaojie Wang},
journal= {arXiv preprint arXiv:2205.14477},
year = {2022}
}