RCTrans:通过雷达稠密化器与序列解码器实现雷达-相机 Transformer 的 3D 目标检测
计算机视觉与模式识别
2024-12-18 v1 人工智能
摘要
在雷达-相机 3D 目标检测中,雷达点云稀疏且含噪,这给相机和雷达模态的融合带来了困难。为了解决这个问题,我们引入了一种名为雷达-相机 Transformer (RCTrans) 的基于查询的检测方法。具体而言,我们首先设计了一个雷达稠密编码器来丰富稀疏的有效雷达 token,然后将它们与图像 token 拼接。通过这样做,我们可以充分探索每个感兴趣区域的 3D 信息,并减少融合阶段中空 token 的干扰。然后,我们设计了一个剪枝序列解码器,基于获得的 token 和随机初始化的查询来预测 3D 框。为了减轻雷达点云中高度模糊的影响,我们通过序列融合结构逐步定位目标的位置。这有助于在 token 和查询之间获得更精确和灵活的对应关系。解码器中采用了剪枝训练策略,这可以在推理过程中节省大量时间并防止查询失去其独特性。在大规模 nuScenes 数据集上的大量实验证明了我们方法的优越性,并且我们还取得了新的 SOTA 雷达-相机 3D 检测结果。我们的实现可在 https://github.com/liyih/RCTrans 获取。
引用
@article{arxiv.2412.12799,
title = {RCTrans: Radar-Camera Transformer via Radar Densifier and Sequential Decoder for 3D Object Detection},
author = {Yiheng Li and Yang Yang and Zhen Lei},
journal= {arXiv preprint arXiv:2412.12799},
year = {2024}
}
备注
Accepted by AAAI 2025