Win-Win:基于两个窗口训练高分辨率视觉 Transformer
计算机视觉与模式识别
2024-03-25 v2
摘要
Transformer 已成为最先进视觉架构的标准,在图像级和密集像素级任务上均取得了令人印象深刻的性能。然而,训练用于高分辨率像素级任务的视觉 Transformer 成本过高。典型的解决方案归结为分层架构、快速近似注意力或在低分辨率裁剪块上训练。最后一种方案不限制架构选择,但在以远高于训练所用分辨率进行测试时会导致明显的性能下降,从而需要特设且缓慢的后处理方案。在本文中,我们提出了一种用于高分辨率视觉 Transformer 高效训练与推理的新策略。关键原则是在训练期间掩蔽掉大部分高分辨率输入,仅保留 N 个随机窗口。这使模型能够学习每个窗口内 token 之间的局部交互,以及来自不同窗口的 token 之间的全局交互。因此,模型在测试时可直接处理高分辨率输入而无需任何特殊技巧。我们表明该策略在使用诸如旋转嵌入等相对位置嵌入时是有效的。它比全分辨率网络训练快 4 倍,并且与现有方法相比在测试时易于使用。我们将该策略应用于三个具有高分辨率数据的密集预测任务。首先,我们在语义分割任务上表明,具有 2 个窗口的简单设置表现最佳,因此我们的方法得名:Win-Win。其次,我们在单目深度预测任务上确认了这一结果。第三,我们进一步将其扩展到双目的光流任务,在包含全高清图像的 Spring 基准上达到了最先进的性能,且推理比最佳竞争者快一个数量级。
引用
@article{arxiv.2310.00632,
title = {Win-Win: Training High-Resolution Vision Transformers from Two Windows},
author = {Vincent Leroy and Jerome Revaud and Thomas Lucas and Philippe Weinzaepfel},
journal= {arXiv preprint arXiv:2310.00632},
year = {2024}
}
备注
ICLR 2024