中文

KAN-Mixers:一种用于图像分类的新深度学习架构

计算机视觉与模式识别 2025-03-13 v1 人工智能

摘要

由于其卓越的性能,卷积神经网络 (CNN) 和视觉 Transformer (ViT) 架构已成为解决计算机视觉任务的标准。此类架构需要大型数据集,并依赖卷积和自注意力操作。2021 年,MLP-Mixer 问世,这是一种仅依赖多层感知机 (MLP) 的架构,与 CNN 和 ViT 相比取得了极具竞争力的结果。尽管 MLP-Mixer 架构在计算机视觉任务中表现良好,但它可能不适合图像中的精细特征提取。最近,Kolmogorov-Arnold 网络 (KAN) 被提出作为 MLP 模型的极具前景的替代方案。与 MLP 相比,KAN 有望提高准确性和可解释性。因此,本研究旨在设计一种新的基于 mixer 的架构,称为 KAN-Mixers,使用 KAN 作为主要层,并在图像分类任务中评估其在多项性能指标上的表现。作为主要获得的结果,KAN-Mixers 模型在 Fashion-MNIST 和 CIFAR-10 数据集上优于 MLP、MLP-Mixer 和 KAN 模型,平均准确率分别为 0.9030 和 0.6980。

关键词

引用

@article{arxiv.2503.08939,
  title  = {KAN-Mixers: a new deep learning architecture for image classification},
  author = {Jorge Luiz dos Santos Canuto and Linnyer Beatrys Ruiz Aylon and Rodrigo Clemente Thom de Souza},
  journal= {arXiv preprint arXiv:2503.08939},
  year   = {2025}
}

备注

8 pages, 6 figures