中文

RoScenes:面向路边感知的大规模多视图3D数据集

计算机视觉与模式识别 2024-07-08 v4

摘要

我们介绍了RoScenes,这是最大的多视图路边感知数据集,旨在为更具挑战性的交通场景开发以视觉为中心的鸟瞰图(BEV)方法提供启示。RoScenes的亮点包括显著大的感知区域、完整的场景覆盖和拥挤的交通。具体而言,我们的数据集在64,000平方米范围内实现了惊人的21.13M个3D标注。为了减轻路边3D标注的昂贵成本,我们提出了一种新颖的BEV-to-3D联合标注流程,以高效地收集如此大量的数据。之后,我们在RoScenes上对当前BEV方法进行了全面的有效性和效率研究。测试的方法由于感知区域广阔以及场景间传感器布局的变化,性能未达到预期。为此,我们提出了RoBEV,它结合了特征引导的位置嵌入以实现有效的2D-3D特征分配。借助RoBEV,我们的方法在验证集上以无额外计算开销的优势大幅超越了现有技术。我们的数据集和开发工具包将在https://github.com/xiaosu-zhu/RoScenes提供。

关键词

引用

@article{arxiv.2405.09883,
  title  = {RoScenes: A Large-scale Multi-view 3D Dataset for Roadside Perception},
  author = {Xiaosu Zhu and Hualian Sheng and Sijia Cai and Bing Deng and Shaopeng Yang and Qiao Liang and Ken Chen and Lianli Gao and Jingkuan Song and Jieping Ye},
  journal= {arXiv preprint arXiv:2405.09883},
  year   = {2024}
}

备注

ECCV 2024. Extended version. 33 pages, 21 figures, 13 tables. https://github.com/xiaosu-zhu/RoScenes