RiemannFormer:曲面空间注意力框架
机器学习
2025-12-16 v3
摘要
本研究旨为 transformer 架构提供几何解释,以釐清其注意力机制的本质。我们的框架中,注意力主要涉及度量张量、切空间、内积以及它们之间的关系。这些量与结构在离散位置上通过切向量的平行运输相互紧密关联。为提高学习效率,我们通过巧妙的预定义配置减少参数数量。此外,我们引入显式机制以削弱远程值,凸显邻域效应,因而弥补 transformer 本身忽略局部归纳偏置的不足。实验结果表明,我们的模块相较于基线模型在性能上实现显著提升。后续将开展在视觉模型和大型语言模型上的更多评估实验。
关键词
引用
@article{arxiv.2506.07405,
title = {RiemannFormer: A Framework for Attention in Curved Spaces},
author = {Zhongping Ji},
journal= {arXiv preprint arXiv:2506.07405},
year = {2025}
}
备注
18 pages, 1 figure