Transformer 用于俯视影像识别:一项现实检验
计算机视觉与模式识别
2022-11-02 v2
摘要
有证据表明,transformer 在为俯视影像(如卫星影像)设计的任务上提供了最先进的识别性能。然而,要在相互竞争的深度学习模型间做出无偏的经验比较十分困难,以至于尚不清楚基于 transformer 的模型是否有益、以及在何种程度上有益。本文中,我们系统性地比较了在俯视影像最先进分割模型中引入 transformer 结构的影响。每个模型被赋予相近的自由参数预算,并使用贝叶斯优化在固定的数据量与计算时间内优化其超参数。我们使用由两大公共基准 Inria 与 DeepGlobe 组成的大型多样数据集开展实验。我们进行了额外的消融研究以探究特定基于 transformer 的建模选择的影响。我们的结果表明,transformer 带来一致但有限的性能提升。然而,我们仅在结合卷积与 transformer 结构的混合模型中观察到该优势,而完全基于 transformer 的模型表现相对较差。
引用
@article{arxiv.2210.12599,
title = {Transformers For Recognition In Overhead Imagery: A Reality Check},
author = {Francesco Luzi and Aneesh Gupta and Leslie Collins and Kyle Bradbury and Jordan Malof},
journal= {arXiv preprint arXiv:2210.12599},
year = {2022}
}
备注
This paper has been accepted to WACV 2023, but this is not the final version