中文

HGFormer:基于超图学习的拓扑感知视觉变换器

计算机视觉与模式识别 2025-04-10 v2

摘要

计算机视觉领域过去两年里 witnessed 了视觉变换器的广泛探索。drawing inspiration from 传统方法,诸多研究聚焦于引入视觉特定的归纳偏置。然而,隐式建模置换不变性和与单个 token 完全连接的相互作用,会破坏区域上下文和空间拓扑,进而阻碍更高阶的建模。这偏离了强调局部组合并关注整体拓扑的感知组织原则。因此,我们引入超图概念用于感知探索。具体而言,我们提出了称为超图变换器(HyperGraph Transformer, HGFormer)的拓扑感知视觉变换器。首先,我们提出了用于超图构建中的语义引导的中心采样 K 最近邻(CS-KNN)算法。其次,我们提出了拓扑感知的超图注意力(HGA)机制,将超图拓扑作为感知指示,引导超图消息传递中全局且不偏向的信息聚合。使用 HGFormer 作为视觉主干,我们构建了有效且统一的表征,实现了清晰且细致的场景描绘。实验结果表明,所提出的 HGFormer 在 various visual benchmarks 上与最新 SOTA 方法表现相当。广泛的消融和可视化研究提供了对我们想法和贡献的全面解释。

关键词

引用

@article{arxiv.2504.02440,
  title  = {HGFormer: Topology-Aware Vision Transformer with HyperGraph Learning},
  author = {Hao Wang and Shuo Zhang and Biao Leng},
  journal= {arXiv preprint arXiv:2504.02440},
  year   = {2025}
}