中文

SPoT:视觉Transformer中亚像素级Token放置

计算机视觉与模式识别 2026-03-09 v2 机器学习

摘要

视觉Transformer天然支持稀疏性,但标准的分词方法将特征限制在离散的补丁网格上。这种约束阻碍了模型充分发挥稀疏 regime 的潜力,迫使模型必须进行笨拙的权衡。我们提出了Token的亚像素级放置策略(Subpixel Placement of Tokens, SPoT),该策略将Token连续地定位于图像内部,有效地规避了基于网格的限制。在我们提出的oracle引导搜索下,我们发现理想的亚像素Token位置可实现显著的性能提升,大幅降低推理阶段所需的Token数量。SPoT为灵活、高效且可解释的ViT架构提供了新方向,将稀疏性重新定义为战略优势而非被动限制。

关键词

引用

@article{arxiv.2507.01654,
  title  = {SPoT: Subpixel Placement of Tokens in Vision Transformers},
  author = {Martine Hjelkrem-Tan and Marius Aasan and Gabriel Y. Arteaga and Adín Ramírez Rivera},
  journal= {arXiv preprint arXiv:2507.01654},
  year   = {2026}
}

备注

Appeared in Workshop on Efficient Computing under Limited Resources: Visual Computing (ICCV 2025). Code available at https://github.com/dsb-ifi/SPoT