当城市教会车辆:基于基础设施的无标签3D感知
计算机视觉与模式识别
2026-03-18 v1
摘要
自主驾驶的鲁棒3D感知仍严重依赖大规模数据收集和手动标注,但随着部署在多样化城市和地区的扩展,这种范式变得不可行。与此同时,现代城市日益安装了路侧单元(RSUs),这些单元沿道路和交叉口部署,以监控交通。这自然引出了一个问题:城市本身能否帮助训练车辆?我们提出一种基础设施教会的、无标签3D感知范式,其中RSUs充当 ego 车辆的 stationary、无监督教师。利用其固定视角和重复观察,RSUs从无标签数据中学习本地3D检测器并广播预测给经过的车辆,这些车辆被聚合为伪标签监督,用于训练独立的ego检测器。最终模型在测试时无需基础设施或通信。我们将这一概念实现为一个完全无标签的三阶段管道,并在基于CARLA的多智能体环境中进行概念和可行性研究。使用CenterPoint,我们的管道实现了82.3%的检测精度(vehicle),与完全监督的ego上限为94.4%。我们进一步系统性地分析了每个阶段,评估了其可扩展性,并演示了与现有ego中心无标签方法的互补性。总而言之,这些结果表明,城市基础设施本身可能为自主车辆提供可扩展的监督信号,使基础设施教会学习成为降低3D感知标注成本的有前景的正交范式。
引用
@article{arxiv.2603.16742,
title = {When the City Teaches the Car: Label-Free 3D Perception from Infrastructure},
author = {Zhen Xu and Jinsu Yoo and Cristian Bautista and Zanming Huang and Tai-Yu Pan and Zhenzhen Liu and Katie Z Luo and Mark Campbell and Bharath Hariharan and Wei-Lun Chao},
journal= {arXiv preprint arXiv:2603.16742},
year = {2026}
}
备注
Project Page: https://jinsuyoo.info/civet/