中文

面向无人机目标识别的旋转不变Transformer

计算机视觉与模式识别 2023-11-07 v1

摘要

从无人机中识别感兴趣目标比现有跨多城市摄像头的行人重识别任务更具挑战性。无人机拍摄的图像在生成目标边界框时通常存在显著尺寸差异以及不确定的旋转变化。现有方法通常针对城市摄像头设计,无法处理无人机场景中的旋转问题。一种直接的解决方案是进行图像级旋转增强,但这在将强大的视觉Transformer以图像块形式输入时会造成有用信息丢失。这促使我们在图像块特征层面模拟旋转操作,提出一种新颖的旋转不变视觉Transformer(RotTrans)。该策略借助视觉Transformer结构的特性构建于高层特征之上,增强了对大旋转差异的鲁棒性。此外,我们设计不变性约束以建立原始特征与旋转特征之间的关系,实现更强的旋转不变性。我们提出的Transformer在最新无人机数据集上的测试大幅优于当前最优方法,其mAP和Rank1分别比最高值高出5.9%和4.8%。值得注意的是,我们的模型在传统城市摄像头的行人重识别任务上也具有竞争力。特别地,我们的方案在ICCV 2021举办的多模态视频推理与分析竞赛中基于无人机的行人重识别赛道获得第一名。代码见https://github.com/whucsy/RotTrans。

关键词

引用

@article{arxiv.2311.02559,
  title  = {Rotation Invariant Transformer for Recognizing Object in UAVs},
  author = {Shuoyi Chen and Mang Ye and Bo Du},
  journal= {arXiv preprint arXiv:2311.02559},
  year   = {2023}
}

备注

ACM MM2022