中文

Kolmogorov-Arnold 注意力:可学习注意力对视觉 Transformer 更好吗?

机器学习 2025-10-23 v3 计算机视觉与模式识别

摘要

Kolmogorov-Arnold 网络(KANs)是一项卓越的创新,由可学习激活函数组成,具有从数据中捕获更复杂关系的潜力。目前,KANs 通过替换深度网络中的多层感知器(MLPs)来部署,包括先进架构如视觉 Transformer(ViTs)。本研究探讨 KAN 是否能够学习 token 交互。在本文中,我们设计了首个可学习注意力——Kolmogorov-Arnold 注意力(KArAt),用于 ViTs,可在任意基上运行,涵盖傅里叶基、小波、样条到有理函数。然而,注意力中的可学习激活会导致内存爆炸。为解决此问题,我们提出使用低秩近似的 KArAt 模块化版本。通过采用傅里叶基,Fourier-KArAt 及其变体在某些情况下优于传统的 softmax 对应方法,或在 CIFAR-10、CIFAR-100 和 ImageNet-1K 上展现出可比性能。我们还将 Fourier KArAt 部署到 ConViT 和 Swin-Transformer,并在 ViT-Det 中将其用于检测和分割。通过分析损失景观、权重分布、优化器路径、注意力可视化和向其他数据集的迁移性,我们剖析了这些架构的性能。KArAt 的可学习激活在所有 ViTs 中产生了更好的注意力分数,表明 token-to-token 交互得到改善,并有助于增强推理。然而,其泛化能力并未随更大 ViTs 而扩展。尽管如此,包括当前计算接口在内的许多因素影响了参数和内存密集的 KArAt 的相对性能。我们指出,本文的目标并非产生高效注意力或挑战传统激活;通过设计 KArAt,我们首次展示了注意力可以被学习,并鼓励研究者在更先进架构中探索 KArAt。

关键词

引用

@article{arxiv.2503.10632,
  title  = {Kolmogorov-Arnold Attention: Is Learnable Attention Better For Vision Transformers?},
  author = {Subhajit Maity and Killian Hitsman and Xin Li and Aritra Dutta},
  journal= {arXiv preprint arXiv:2503.10632},
  year   = {2025}
}

备注

Preprint, Appendix included