中文

HexFormer:基于指数映射聚合的双曲视觉 Transformer

计算机视觉与模式识别 2026-01-28 v1

摘要

图像、文本和图等跨模态数据通常包含层次结构和关系结构,这些结构在欧几里得几何内难以建模。双曲几何为表示此类结构提供了自然框架。基于这一性质,本工作引入了 HexFormer,一种用于图像分类的双曲视觉 Transformer,其注意力机制中结合了指数映射聚合。我们探索了两种设计:双曲 ViT(HexFormer)和结合双曲编码器与欧几里得线性分类头的混合变体。HexFormer 融合了基于指数映射聚合的新型注意力机制,相比标准的基于质心的平均方法,能产生更准确且更稳定的聚合表示,这表明更简单的方法仍具有竞争力。在多个数据集上的实验表明,相较于欧几里得基线和先前的双曲 ViT,性能获得了持续提升,其中混合变体取得了最佳的整体结果。此外,本研究还对双曲 Transformer 中的梯度稳定性进行了分析。结果显示,与欧几里得架构相比,双曲模型表现出更稳定的梯度,且对预热策略的敏感性降低,凸显了其在训练中的鲁棒性与高效性。总体而言,这些发现表明双曲几何可以通过改善梯度稳定性和准确度来增强视觉 Transformer 架构。此外,诸如指数映射聚合等相对简单的机制也能提供强大的实用效益。

关键词

引用

@article{arxiv.2601.19849,
  title  = {HexFormer: Hyperbolic Vision Transformer with Exponential Map Aggregation},
  author = {Haya Alyoussef and Ahmad Bdeir and Diego Coello de Portugal Mecke and Tom Hanika and Niels Landwehr and Lars Schmidt-Thieme},
  journal= {arXiv preprint arXiv:2601.19849},
  year   = {2026}
}