TOD3Cap:迈向室外场景的 3D 密集描述
计算机视觉与模式识别
2024-06-07 v2
摘要
3D 密集描述是通过自然语言全面理解 3D 场景的基石。近期它取得了显著成果,特别是在室内环境中。然而,室外场景中 3D 密集描述的探索受到两大主要挑战的阻碍:1)室内外场景之间的领域差距(如动态和稀疏的视觉输入),使得直接应用现有的室内方法变得困难;2)缺乏专门针对室外场景定制的带有全面边界框-描述对标注的数据。为此,我们引入了室外 3D 密集描述这一新任务。作为输入,我们假设输入为 LiDAR 点云和由全景相机阵列捕获的一组 RGB 图像。预期输出是一组带有描述的目标边界框。为解决这一任务,我们提出了 TOD3Cap 网络,该网络利用 BEV 表示生成目标边界框提议,并集成 Relation Q-Former 与 LLaMA-Adapter 为这些目标生成丰富的描述。我们还引入了 TOD3Cap 数据集,据我们所知,这是目前用于室外场景 3D 密集描述的最大数据集,包含来自 850 个场景的 64.3K 个室外目标的 2.3M 条描述。值得注意的是,我们的 TOD3Cap 网络能够有效地定位并描述室外场景中的 3D 目标,以显著优势(+9.6 [email protected])超越了基线方法。代码、数据和模型已公开于 https://github.com/jxbbb/TOD3Cap。
引用
@article{arxiv.2403.19589,
title = {TOD3Cap: Towards 3D Dense Captioning in Outdoor Scenes},
author = {Bu Jin and Yupeng Zheng and Pengfei Li and Weize Li and Yuhang Zheng and Sujie Hu and Xinyu Liu and Jinwei Zhu and Zhijie Yan and Haiyang Sun and Kun Zhan and Peng Jia and Xiaoxiao Long and Yilun Chen and Hao Zhao},
journal= {arXiv preprint arXiv:2403.19589},
year = {2024}
}
备注
Code, data, and models are publicly available at https://github.com/jxbbb/TOD3Cap