中文

超越网格:探索视觉Transformer的弹性输入采样

计算机视觉与模式识别 2025-10-22 v2

摘要

视觉Transformer在各种计算机视觉任务中表现出色,但大多依赖使用固定尺寸图像块网格的刚性输入采样。这限制了它们在现实问题中的适用性,例如具有不同尺度与位置图像块的主动视觉探索。本文通过形式化视觉Transformer的输入弹性概念并引入衡量该弹性的评估协议,来解决这一局限。此外,我们提出对Transformer架构与训练机制进行修改,以提升其弹性。通过大量实验,我们揭示了与此类架构相关的机遇与挑战。

关键词

引用

@article{arxiv.2309.13353,
  title  = {Beyond Grids: Exploring Elastic Input Sampling for Vision Transformers},
  author = {Adam Pardyl and Grzegorz Kurzejamski and Jan Olszewski and Tomasz Trzciński and Bartosz Zieliński},
  journal= {arXiv preprint arXiv:2309.13353},
  year   = {2025}
}

备注

WACV 2025