超越网格:探索视觉Transformer的弹性输入采样
计算机视觉与模式识别
2025-10-22 v2
摘要
视觉Transformer在各种计算机视觉任务中表现出色,但大多依赖使用固定尺寸图像块网格的刚性输入采样。这限制了它们在现实问题中的适用性,例如具有不同尺度与位置图像块的主动视觉探索。本文通过形式化视觉Transformer的输入弹性概念并引入衡量该弹性的评估协议,来解决这一局限。此外,我们提出对Transformer架构与训练机制进行修改,以提升其弹性。通过大量实验,我们揭示了与此类架构相关的机遇与挑战。
引用
@article{arxiv.2309.13353,
title = {Beyond Grids: Exploring Elastic Input Sampling for Vision Transformers},
author = {Adam Pardyl and Grzegorz Kurzejamski and Jan Olszewski and Tomasz Trzciński and Bartosz Zieliński},
journal= {arXiv preprint arXiv:2309.13353},
year = {2025}
}
备注
WACV 2025