先验具有力量:利用二维先验改进用于多相机三维检测的 Transformer
计算机视觉与模式识别
2023-02-01 v1 机器人学
摘要
基于 Transformer 的方法推动了学术界与工业界多相机三维检测的最近发展。在朴素 Transformer 架构中,查询被随机初始化并为整个数据集优化,未考虑输入帧之间的差异。本工作中,我们提出利用图像骨干网络的预测(其通常针对二维任务高度优化)作为三维检测网络 Transformer 部分的先验。该方法通过以下方式实现:(1)用二维先验增强图像特征图;(2)沿二维框质心通过光线投射采样查询位置;以及(3)用目标级图像特征初始化查询特征。实验结果表明,二维先验不仅帮助模型更快收敛,还使基线方法在平均精度上提升多达 12%。
引用
@article{arxiv.2301.13592,
title = {Priors are Powerful: Improving a Transformer for Multi-camera 3D Detection with 2D Priors},
author = {Di Feng and Francesco Ferroni},
journal= {arXiv preprint arXiv:2301.13592},
year = {2023}
}