面向 Vision Transformer 的 Weierstrass 位置编码
计算机视觉与模式识别
2026-05-25 v1 人工智能
摘要
Vision Transformer 在计算机视觉领域取得了显著的成功,但其常用的可学习的一维位置编码削弱了图像展平后二维空间结构的内在优势。现有的定位编码往往缺乏几何约束,且不保留欧几里得空间距离与序列索引距离之间的单调关系,这限制了 ViT 利用空间近似性先验的能力。鼓励周期性在位置编码中的作用,我们提出 Weierstrass 椭圆位置编码 (WePE),一种基于数学方法,用于在复平面上编码二维坐标。WePE 将归一化的二维 patch 坐标映射到复平面,并利用 Weierstrass 椭圆函数及其导数构建紧凑的四维位置特征。双周期性提供了二维位置的原则性表示,其内在晶格结构自然匹配图像 patch 网格的规则几何。其非线性几何特性有助于更忠实地建模空间距离关系,而代数加法公式则可直接从绝对编码中推导出任意 patch 对之间的相对位置信息。WePE 是即插即用且分辨率无关的,允许无缝集成到现有的 ViT 中。大量实验表明,WePE 在大多数设置下都能带来一致的性能提升。通过预计算查找表,这些改进在计算和内存开销方面几乎没有可感知的影响。额外的分析和消融研究进一步验证了所提方法的有效性。
引用
@article{arxiv.2605.23719,
title = {Weierstrass Positional Encoding for Vision Transformers},
author = {Zhihang Xin and Rui Wang and Xitong Hu and Xiaojun Wu},
journal= {arXiv preprint arXiv:2605.23719},
year = {2026}
}