SSD-MonoDETR:用于单目三维目标检测的监督式尺度感知可变形 Transformer
计算机视觉与模式识别
2023-09-04 v4 机器人学
图像与视频处理
摘要
基于 Transformer 的方法近期在单目三维目标检测中展现出优越性能,其旨在从单张 2D 图像预测 3D 属性。大多数现有基于 Transformer 的方法同时利用视觉与深度表示来探索物体上有价值的查询点,而所学查询点的质量对检测精度有很大影响。遗憾的是,Transformer 中现有的无监督注意力机制由于感受野不准确,容易产生低质量查询特征,尤其在困难物体上。为解决这个问题,本文提出一种用于单目三维目标检测的新型“监督式尺度感知可变形注意力”(SSDA)。具体而言,SSDA 预设若干不同尺度的掩码,并利用深度与视觉特征自适应地学习尺度感知滤波器以进行目标查询增强。通过引入尺度感知,SSDA 能良好预测物体查询的准确感受野,从而支持鲁棒的查询特征生成。此外,SSDA 被赋予一个加权尺度匹配(WSM)损失来监督尺度预测,与无监督注意力机制相比给出更可信的结果。在 KITTI 和 Waymo Open 数据集上的大量实验表明,SSDA 显著提升了检测精度,尤其在中等与困难物体上,相较现有方法取得了最先进的性能。我们的代码将公开于 https://github.com/mikasa3lili/SSD-MonoDETR。
引用
@article{arxiv.2305.07270,
title = {SSD-MonoDETR: Supervised Scale-aware Deformable Transformer for Monocular 3D Object Detection},
author = {Xuan He and Fan Yang and Kailun Yang and Jiacheng Lin and Haolong Fu and Meng Wang and Jin Yuan and Zhiyong Li},
journal= {arXiv preprint arXiv:2305.07270},
year = {2023}
}
备注
Accepted to IEEE Transactions on Intelligent Vehicles (T-IV). Code will be made publicly available at https://github.com/mikasa3lili/SSD-MonoDETR