ViKANformer:将Kolmogorov-Arnold网络嵌入视觉Transformer用于基于模式的学习
计算机视觉与模式识别
2025-03-04 v1
摘要
视觉Transformer (ViT) 通过对 patch 嵌入应用自注意力机制显著推进了图像分类。然而,每个Transformer层中的标准MLP模块可能无法最佳捕获复杂的非线性依赖。本文提出ViKANformer,即将每个Transformer子层的MLP替换为Kolmogorov-Arnold网络 (KAN) 扩展,包括 Vanilla KAN、Efficient-KAN、Fast-KAN、SineKAN 和 FourierKAN,同时也检查了Flash注意力变体。凭借Kolmogorov-Arnold定理,该定理保证多变量连续函数可通过单变量连续函数之和表达,从而旨在提升表示力。在MNIST上实验结果表明,SineKAN、Fast-KAN 和经过良好调谐的 Vanilla KAN 均可实现超过 97% 的准确率,尽管伴随增加的训练开销。这一权衡表明,如果计算成本可接受,KAN扩展可能是有益的。我们详细描述了扩展,呈现了训练/测试准确率和 F1/ROC 指标,并提供了可复现的伪代码和超参数。最后,我们将ViKANformer与简单的MLP和小型CNN基线在MNIST上进行比较,说明即使在小规模数据集上,基于Transformer的方法仍具有效率。
引用
@article{arxiv.2503.01124,
title = {ViKANformer: Embedding Kolmogorov Arnold Networks in Vision Transformers for Pattern-Based Learning},
author = {Shreyas S and Akshath M},
journal= {arXiv preprint arXiv:2503.01124},
year = {2025}
}
备注
This paper represents ongoing research and may be subject to revisions, refinements, and additional experiments in future updates