中文

一种计算高效的多维视觉Transformer

机器学习 2026-02-24 v1 数值分析 数值分析

摘要

视觉Transformer在广泛的计算机视觉任务中取得了最先进的性能,但其实际部署受到高计算和内存成本的限制。在本文中,我们引入了一种新颖的基于张量的视觉Transformer框架,该框架建立在张量余弦积(Cproduct)之上。通过利用图像数据中固有的多线性结构和余弦变换的正交性,所提出的方法能够实现高效的注意力机制和结构化的特征表示。我们发展了张量余弦积的理论基础,分析了其代数性质,并将其集成到一种新的基于Cproduct的视觉Transformer架构(TCP-ViT)中。在标准分类和分割基准上的数值实验表明,所提出的方法实现了均匀的1/C参数缩减(其中C是通道数),同时保持了有竞争力的精度。

关键词

引用

@article{arxiv.2602.19982,
  title  = {A Computationally Efficient Multidimensional Vision Transformer},
  author = {Alaa El Ichi and Khalide Jbilou},
  journal= {arXiv preprint arXiv:2602.19982},
  year   = {2026}
}