中文

面向多帧三维目标检测的空间-时间图增强DETR

计算机视觉与模式识别 2025-08-21 v4

摘要

检测Transformer(DETR)革新了基于CNN的目标检测系统设计,展现出令人印象深刻的性能。然而,其在多帧三维目标检测领域的潜力仍很大程度上未被探索。本文提出 STEMD,一种新颖的端到端框架,通过针对该任务三个关键方面增强类 DETR 范式以用于多帧三维目标检测。首先,为建模对象间空间交互与复杂时间依赖,我们引入空间-时间图注意力网络,将查询表示为图中的节点,并实现对社交上下文中对象交互的有效建模。为解决当前帧编码器所提输出中缺失困难样本的问题,我们融入前一帧的输出以初始化解码器的查询输入。最后,网络难以区分正查询与其他高度相似但非最佳匹配的查询,且相似查询抑制不足而变为冗余预测框。为此,我们提出的 IoU 正则项鼓励相似查询在精炼过程中保持区分。通过大量实验,我们证明了该方法在处理挑战性场景中的有效性,且仅带来微小的额外计算开销。代码公开于 https://github.com/Eaphan/STEMD。

关键词

引用

@article{arxiv.2307.00347,
  title  = {Spatial-Temporal Graph Enhanced DETR Towards Multi-Frame 3D Object Detection},
  author = {Yifan Zhang and Zhiyu Zhu and Junhui Hou and Dapeng Wu},
  journal= {arXiv preprint arXiv:2307.00347},
  year   = {2025}
}

备注

16 pages, 9 figures; Accepted by IEEE TPAMI