中文

CS-Mixer:一种具有空间-通道混合的跨尺度视觉 MLP 模型

计算机视觉与模式识别 2024-10-28 v2

摘要

尽管与 Vision Transformers 和卷积神经网络相比,视觉 MLP 架构的信息融合设计更为简单,但近期研究表明其具有强劲性能与高数据效率。然而,CycleMLP 和 Vision Permutator 等现有工作通常在等尺寸空间区域中建模空间信息,未考虑跨尺度空间交互。此外,其 token mixer 仅建模 1 或 2 轴关联,因计算开销而避免 3 轴空间-通道混合。因此我们提出 CS-Mixer,一种分层视觉 MLP,通过跨尺度局部与全局聚合学习用于空间-通道混合的动态低秩变换。所提方法在流行图像识别基准上取得了具竞争力的结果,且未显著增加计算量。我们最大的模型 CS-Mixer-L 在 ImageNet-1k 上以 13.7 GFLOPs 和 94 M 参数达到 83.2% 的 top-1 准确率。

关键词

引用

@article{arxiv.2308.13363,
  title  = {CS-Mixer: A Cross-Scale Vision MLP Model with Spatial-Channel Mixing},
  author = {Jonathan Cui and David A. Araujo and Suman Saha and Md. Faisal Kabir},
  journal= {arXiv preprint arXiv:2308.13363},
  year   = {2024}
}

备注

8 pages, 5 figures, developed under Penn State University's Multi-Campus Research Experience for Undergraduates Symposium, 2023. This work has been submitted to the IEEE for possible publication