中文

面向旋转目标检测的空间变换解耦

计算机视觉与模式识别 2024-02-23 v2

摘要

Vision Transformers (ViTs) 已在计算机视觉任务中取得显著成功。然而,其在旋转敏感场景中的潜力尚未被充分挖掘,该局限可能本质上源于数据前向过程中空间不变性的缺失。本研究提出一种称为空间变换解耦(Spatial Transform Decoupling, STD)的新方法,为基于 ViT 的旋转目标检测提供了简洁而有效的方案。STD 构建于堆叠的 ViT 模块之上,利用分离的网络分支预测边界框的位置、尺寸与角度,以分而治之的方式有效释放 ViT 的空间变换潜力。此外,通过聚合基于回归参数计算的级联激活掩码(CAMs),STD 逐步增强感兴趣区域(RoIs)内特征,从而补充自注意力机制。无需额外技巧,STD 在包括 DOTA-v1.0(82.24% mAP)与 HRSC2016(98.55% mAP)在内的基准数据集上取得了最先进性能,证明了所提方法的有效性。源代码见 https://github.com/yuhongtian17/Spatial-Transform-Decoupling。

关键词

引用

@article{arxiv.2308.10561,
  title  = {Spatial Transform Decoupling for Oriented Object Detection},
  author = {Hongtian Yu and Yunjie Tian and Qixiang Ye and Yunfan Liu},
  journal= {arXiv preprint arXiv:2308.10561},
  year   = {2024}
}

备注

Accepted by AAAI 2024