中文

基于注意力深度蒸馏与3D感知位置编码的单目3D目标检测

计算机视觉与模式识别 2023-07-04 v2

摘要

单目3D目标检测是一项低成本但具挑战性的任务,因为它需要仅从单幅图像输入生成准确的3D定位。近期开发的深度辅助方法通过使用显式深度图作为中间特征展现出有前景的结果,这些深度图或由单目深度估计网络预计算,或与3D目标检测联合评估。然而,估计深度先验中不可避免的错误可能导致语义信息与3D定位错位,从而造成特征涂抹和次优预测。为缓解此问题,我们提出ADD,一种基于注意力的深度知识蒸馏框架,带有3D感知位置编码。与先前采用立体或基于LiDAR的教师模型的蒸馏框架不同,我们构建的教师模型与学生架构相同,但额外输入真实深度。得益于我们的教师设计,框架无缝、无域差距、易实现,且兼容逐目标真实深度。具体而言,我们利用中间特征与响应进行知识蒸馏。考虑到长程3D依赖,我们提出\emph{3D感知自注意力}与\emph{目标感知交叉注意力}模块用于学生适配。在具挑战性的KITTI 3D目标检测基准上进行了大量实验验证框架有效性。我们在三个代表性单目检测器上实现框架,并取得最先进性能,且相对基线模型无额外推理计算成本。代码见https://github.com/rockywind/ADD。

关键词

引用

@article{arxiv.2211.16779,
  title  = {Attention-Based Depth Distillation with 3D-Aware Positional Encoding for Monocular 3D Object Detection},
  author = {Zizhang Wu and Yunzhe Wu and Jian Pu and Xianzhi Li and Xiaoquan Wang},
  journal= {arXiv preprint arXiv:2211.16779},
  year   = {2023}
}

备注

Accepted by AAAI2023