中文

DynaMixer:一种具有动态混合机制的视觉 MLP 架构

计算机视觉与模式识别 2022-06-22 v3 机器学习

摘要

近来,类 MLP 视觉模型在主流视觉识别任务上取得了有前景的性能。与视觉 transformers 和 CNNs 不同,类 MLP 模型的成功表明,token 与通道间简单的信息融合操作即可为深度识别模型提供良好的表示能力。然而,现有类 MLP 模型通过静态融合操作融合 token,缺乏对待混合 token 内容的适应性。因此,常规的融合过程不够有效。为此,本文提出一种高效的类 MLP 网络架构,称为 DynaMixer,借助动态信息融合实现。关键地,我们提出了一种 DynaMixer 模型所依赖的过程,通过利用所有待混合 token 的内容来动态生成混合矩阵。为降低时间复杂度并提升鲁棒性,采用了降维技术与多段融合机制。我们提出的 DynaMixer 模型(97M 参数)在无额外训练数据的情况下于 ImageNet-1K 数据集上达到 84.3\% 的 top-1 准确率,优于当前最优的类视觉 MLP 模型。当参数量减至 26M 时,其仍达到 82.7\% 的 top-1 准确率,超越具有相近容量的现有类 MLP 模型。代码见 \url{https://github.com/ziyuwwang/DynaMixer}。

关键词

引用

@article{arxiv.2201.12083,
  title  = {DynaMixer: A Vision MLP Architecture with Dynamic Mixing},
  author = {Ziyu Wang and Wenhao Jiang and Yiming Zhu and Li Yuan and Yibing Song and Wei Liu},
  journal= {arXiv preprint arXiv:2201.12083},
  year   = {2022}
}

备注

icml2022