中文

近端视觉变换器:通过双阶段流形几何增强特征表示

计算机视觉与模式识别 2025-08-26 v1 人工智能

摘要

视觉变换器(ViT)架构在计算机视觉领域广受认可,利用自注意力机制在 various 任务上取得显著成绩。尽管具有优势,但 ViT 的优化局限于建模单个图像内的局部关系,限制了其捕获数据点之间全局几何关系的能力。为此,本文提出了一种新框架,将 ViT 与近端工具集成,实现统一的几何优化方法以增强特征表示和分类性能。在该框架中,ViT 通过自注意力机制构建流形的切丝束,其中每个注意力头对应一个切空间,提供来自多样局部视角的几何表示。随后引入近端迭代,以定义切丝束内的切片,并将数据从切空间投影到基空间,实现全局特征对齐和优化。实验结果确认,所提方法在分类准确率和数据分布方面均优于传统 ViT。

关键词

引用

@article{arxiv.2508.17081,
  title  = {Proximal Vision Transformer: Enhancing Feature Representation through Two-Stage Manifold Geometry},
  author = {Haoyu Yun and Hamid Krim},
  journal= {arXiv preprint arXiv:2508.17081},
  year   = {2025}
}