KAN-Mixers:一种用于图像分类的新深度学习架构
计算机视觉与模式识别
2025-03-13 v1 人工智能
摘要
由于其卓越的性能,卷积神经网络 (CNN) 和视觉 Transformer (ViT) 架构已成为解决计算机视觉任务的标准。此类架构需要大型数据集,并依赖卷积和自注意力操作。2021 年,MLP-Mixer 问世,这是一种仅依赖多层感知机 (MLP) 的架构,与 CNN 和 ViT 相比取得了极具竞争力的结果。尽管 MLP-Mixer 架构在计算机视觉任务中表现良好,但它可能不适合图像中的精细特征提取。最近,Kolmogorov-Arnold 网络 (KAN) 被提出作为 MLP 模型的极具前景的替代方案。与 MLP 相比,KAN 有望提高准确性和可解释性。因此,本研究旨在设计一种新的基于 mixer 的架构,称为 KAN-Mixers,使用 KAN 作为主要层,并在图像分类任务中评估其在多项性能指标上的表现。作为主要获得的结果,KAN-Mixers 模型在 Fashion-MNIST 和 CIFAR-10 数据集上优于 MLP、MLP-Mixer 和 KAN 模型,平均准确率分别为 0.9030 和 0.6980。
引用
@article{arxiv.2503.08939,
title = {KAN-Mixers: a new deep learning architecture for image classification},
author = {Jorge Luiz dos Santos Canuto and Linnyer Beatrys Ruiz Aylon and Rodrigo Clemente Thom de Souza},
journal= {arXiv preprint arXiv:2503.08939},
year = {2025}
}
备注
8 pages, 6 figures