中文

ResFormer:基于多分辨率训练扩展视觉Transformer

计算机视觉与模式识别 2023-04-04 v2

摘要

视觉Transformer(ViTs)已取得压倒性的成功,但它们存在分辨率可扩展性脆弱的问题,即在训练时未见过输入分辨率的情况下,性能会急剧下降。我们提出了ResFormer,一个构建于多分辨率训练这一开创性思想之上的框架,用于在广泛且大多未见的测试分辨率上提升性能。具体而言,ResFormer对不同分辨率的复制图像进行操作,并施加尺度一致性损失以促进不同尺度间的交互信息。更重要的是,为在 varying 分辨率(尤其是测试中的新分辨率)间有效切换,我们提出了一种随输入尺寸平滑变化的全局-局部位置嵌入策略。我们在ImageNet上进行了图像分类的广泛实验。结果提供了有力的定量证据,表明ResFormer对广泛分辨率具有可观的扩展能力。例如,ResFormer-B-MR在较低和较高分辨率(即96和640)下评估时分别取得75.86%和81.72%的Top-1准确率,比DeiT-B分别高出48%和7.49%。此外,我们还证明ResFormer具有灵活性,可轻松扩展到语义分割、目标检测和视频动作识别。代码见 https://github.com/ruitian12/resformer。

关键词

引用

@article{arxiv.2212.00776,
  title  = {ResFormer: Scaling ViTs with Multi-Resolution Training},
  author = {Rui Tian and Zuxuan Wu and Qi Dai and Han Hu and Yu Qiao and Yu-Gang Jiang},
  journal= {arXiv preprint arXiv:2212.00776},
  year   = {2023}
}

备注

CVPR 2023