VSRD++:基于实例感知体积轮廓渲染的 3D 目标检测自动标注
计算机视觉与模式识别
2025-12-02 v1
摘要
单目 3D 目标检测是 3D 场景理解中的一个基本而具有挑战性的任务。现有方法高度依赖具有大量 3D 标注的监督学习,这些标注通常通过激光点云获取,过程繁琐。为解决这一问题,我们提出了 VSRD++,一种新型的弱监督框架,用于单目 3D 目标检测,该框架消除了对 3D 标注的依赖,利用神经场-based 的体积渲染结合弱 2D 监督。VSRD++ 包含两个阶段的管道:多视角 3D 自动标注和随后的单目 3D 检测器训练。在多视角自动标注阶段,物体表面表示为符号距离场(SDF),并通过提出的实例感知体积轮廓渲染生成实例掩码。为优化 3D 边界框,我们将每个实例的 SDF 分解为立方体 SDF 和残差距离场(RDF),后者捕捉与立方体的偏差。为解决体积渲染方法应用于动态物体时常见的几何不一致问题,我们通过将速度纳入边界框属性并为每个伪标签分配置信度来建模动态物体。此外,我们还采用 3D 属性初始化模块来初始化动态边界框参数。在单目 3D 目标检测阶段,优化后的 3D 边界框作为监督信号训练单目 3D 目标检测器。在 KITTI-360 数据集上的大量实验表明,VSRD++ 在静态和动态场景中均显著优于现有的弱监督方法。代码已公开 https://github.com/Magicboomliu/VSRD_plus_plus
关键词
引用
@article{arxiv.2512.01178,
title = {VSRD++: Autolabeling for 3D Object Detection via Instance-Aware Volumetric Silhouette Rendering},
author = {Zihua Liu and Hiroki Sakuma and Masatoshi Okutomi},
journal= {arXiv preprint arXiv:2512.01178},
year = {2025}
}
备注
arXiv admin note: text overlap with arXiv:2404.00149