超越展平:基于魏尔斯特拉斯椭圆函数的视觉Transformer几何原理位置编码
计算机视觉与模式识别
2025-08-27 v1
摘要
视觉Transformer在计算机视觉任务中取得了显著成功,然而它们对可学习的一维位置嵌入的依赖,通过图像块展平过程从根本上破坏了图像固有的二维空间结构。传统的位置编码方法缺乏几何约束,无法在欧几里得空间距离和序列索引距离之间建立单调对应关系,从而限制了模型有效利用空间邻近性先验的能力。我们提出了魏尔斯特拉斯椭圆函数位置编码(WEF-PE),这是一种基于数学原理的方法,通过自然的复数域表示直接处理二维坐标,其中椭圆函数的双周期性质与视觉数据中常见的平移不变性模式高度吻合。我们的方法利用椭圆函数的非线性几何性质自然地编码空间距离关系,同时代数加法公式能够直接从绝对编码中推导出任意图像块对之间的相对位置信息。综合实验表明,WEF-PE在多种场景下均取得了优越的性能,包括使用ViT-Tiny架构在CIFAR-100数据集上从头训练达到63.78%的准确率,使用ViT-Base在CIFAR-100数据集上微调达到93.28%的准确率,以及在VTAB-1k基准任务上的持续改进。理论分析通过严格的数学证明证实了距离衰减特性,而注意力可视化则揭示了与传统方法相比增强的几何归纳偏置和更连贯的语义聚焦。实现本文所述方法的源代码已在GitHub上公开发布。
引用
@article{arxiv.2508.19167,
title = {Beyond flattening: a geometrically principled positional encoding for vision transformers with Weierstrass elliptic functions},
author = {Zhihang Xin and Xitong Hu and Rui Wang},
journal= {arXiv preprint arXiv:2508.19167},
year = {2025}
}