面向有限数据下的谱光谱视觉 Transformer 以提高分词效率
计算机视觉与模式识别
2026-05-13 v1 人工智能
信号处理
摘要
我们提出一种 novel spectral vision transformer 架构,用于在有限数据下的高效分词,尤其关注医学成像领域。我们概述了基于所选基函数所产生的便利理论特性,包括空间不变性和最佳信噪比。我们表明,与空间视觉 Transformer 相比,谱投影带来了降低的复杂度。我们表明,在各种模型中(包括紧凑和标准视觉 Transformer、带注意力的卷积神经网络、偏移窗口 Transformer、多层感知机和逻辑回归),spectralViT 在参数数量更少的情况下实现均等或更好的性能。我们包括模拟数据、公共数据和临床数据,并在 \verb+github.com/agr78/spectralViT+ 上发布代码。
关键词
引用
@article{arxiv.2605.12026,
title = {Spectral Vision Transformer for Efficient Tokenization with Limited Data},
author = {Alexandra G. Roberts and Maneesh John and Jinwei Zhang and Dominick Romano and Mert Sisman and Ki Sueng Choi and Heejong Kim and Mert R. Sabuncu and Thanh D. Nguyen and Alexey V. Dimov and Pascal Spincemaille and Brian H. Kopell and Yi Wang},
journal= {arXiv preprint arXiv:2605.12026},
year = {2026}
}