中文

SparseFormer:基于稀疏视觉Transformer用于HRW镜头目标检测

计算机视觉与模式识别 2025-02-12 v1 人工智能

摘要

近年来,Gigapixel级图像和视频捕获系统以及高分辨率宽场(HRW)镜头数据集数量不断增加。然而,与MS COCO数据集中的近景镜头不同,更高的分辨率和更宽的视野带来了独特挑战,如极端稀疏性和巨大的尺度变化,导致现有近景检测器精度和效率下降。本文提出一种新型模型无关的稀疏视觉Transformer,称为SparseFormer,通过有选择地使用注意力token来审查可能包含目标的稀疏分布窗口,从而在近景和HRW镜头之间建立目标检测的鸿沟。如此一来,它能够通过融合粗粒度和细粒度特征来联合探索全局和局部注意力,从而处理巨大的尺度变化。SparseFormer还受益于一种新颖的跨切片非极大抑制(Cross-slice non-maximum suppression, C-NMS)算法,用于从噪声窗口中精确定位目标,以及一种简单有效的多尺度策略以提高准确率。广泛的实验表明,在两个HRW基准数据集PANDA和DOTA-v1.0上,所提出的SparseFormer在检测精度(提升最高达5.8%)和速度(提升最高达3倍)方面显著优于最先进的方法。

关键词

引用

@article{arxiv.2502.07216,
  title  = {SparseFormer: Detecting Objects in HRW Shots via Sparse Vision Transformer},
  author = {Wenxi Li and Yuchen Guo and Jilai Zheng and Haozhe Lin and Chao Ma and Lu Fang and Xiaokang Yang},
  journal= {arXiv preprint arXiv:2502.07216},
  year   = {2025}
}

备注

This paper is accepted to ACM MM 2024