中文

SODFormer:基于事件与帧的 Transformer 流式目标检测

计算机视觉与模式识别 2023-08-09 v1 人工智能 机器人学

摘要

DAVIS 相机流式输出异步事件与帧两种互补感知模态,已逐渐用于应对主要目标检测挑战(如快速运动模糊与低光照)。然而,如何有效利用丰富时间线索并融合两种异构视觉流仍是一项艰巨挑战。为此,我们提出一种新颖的基于 Transformer 的流式目标检测器,即 SODFormer,它首次整合事件与帧以异步方式持续检测目标。技术上,我们首先构建了大规模多模态神经形态目标检测数据集(即 PKU-DAVIS-SOD),含 1080.1k 人工标注。随后,我们设计了一种时空 Transformer 架构,将目标检测作为端到端序列预测问题,其中新颖的时间 Transformer 模块利用两视觉流的丰富时间线索提升检测性能。最后,提出基于异步注意力的融合模块以整合两种异构感知模态并汲取各自互补优势,该模块可随时查询以定位目标,突破基于同步帧的融合策略的输出频率限制。结果表明,所提 SODFormer 大幅优于四种 SOTA 方法与我们的八种基线。我们还展示了该统一框架即使在常规基于帧的相机失效情况下(如高速运动与低光照条件)也表现良好。我们的数据集与代码见 https://github.com/dianzl/SODFormer。

关键词

引用

@article{arxiv.2308.04047,
  title  = {SODFormer: Streaming Object Detection with Transformer Using Events and Frames},
  author = {Dianze Li and Jianing Li and Yonghong Tian},
  journal= {arXiv preprint arXiv:2308.04047},
  year   = {2023}
}

备注

18 pages, 15 figures, in IEEE Transactions on Pattern Analysis and Machine Intelligence