中文

相量Transformer:解决单位圆上的注意力瓶颈

机器学习 2026-03-19 v1 人工智能

摘要

Transformer模型重新定义了序列学习,但点积自注意力为长上下文时间序列引入了二次token混合瓶颈。我们引入了\textbf{Phasor Transformer}模块,一种相位原生替代方案,在单位圆流形S1S^1上表示序列状态。每个模块结合轻量级可学习相位偏移与参数无关的离散傅里叶变换(DFT)token耦合,实现全局O(NlogN)\mathcal{O}(N\log N)混合,无需显式注意力图。堆叠这些模块定义了\textbf{大型相量模型(LPM)}。我们在合成多频率基准上验证了LPM的自回归时间序列预测。在高度紧凑的参数预算下,LPM学习稳定的全局动力学,并与传统自注意力基线相比实现了具有竞争力的预测行为。我们的结果建立了一个明确的效率-性能边界,证明大规模模型的时间序列扩展可以来自受几何约束的相位计算与确定性全局耦合,为振荡领域中的可扩展时间建模提供了一条实用路径。

关键词

引用

@article{arxiv.2603.17433,
  title  = {The Phasor Transformer: Resolving Attention Bottlenecks on the Unit Circle},
  author = {Dibakar Sigdel},
  journal= {arXiv preprint arXiv:2603.17433},
  year   = {2026}
}