POP-3D:基于图像的开放词汇 3D 占据预测
计算机视觉与模式识别
2024-01-18 v1
摘要
我们描述了一种从输入 2D 图像预测开放词汇 3D 语义体素占据图的方法,旨在实现自由形式语言查询的 3D 定位、分割和检索。由于 2D-3D 歧义性以及目标任务的开放词汇特性(使得获取 3D 标注训练数据十分困难),这是一个具有挑战性的问题。本文的贡献主要有三点。首先,我们设计了一种用于开放词汇 3D 语义占据预测的新模型架构。该架构包含一个 2D-3D 编码器,以及占据预测头和 3D-语言头。其输出是一个密集的体素图,包含 3D 定位的语言嵌入,从而支持一系列开放词汇任务。其次,我们开发了一种三模态自监督学习算法,利用三种模态:(i) 图像、(ii) 语言和 (iii) LiDAR 点云,使得能够使用强大的预训练视觉 - 语言模型来训练所提出的架构,而无需任何 3D 人工语言标注。最后,我们在多个开放词汇任务上定量展示了所提出模型的优势:使用现有数据集进行零样本 3D 语义分割;使用我们提出的作为 nuScenes 扩展的小数据集进行自由形式语言查询的 3D 定位和检索。项目页面见 https://vobecant.github.io/POP3D。
引用
@article{arxiv.2401.09413,
title = {POP-3D: Open-Vocabulary 3D Occupancy Prediction from Images},
author = {Antonin Vobecky and Oriane Siméoni and David Hurych and Spyros Gidaris and Andrei Bursuc and Patrick Pérez and Josef Sivic},
journal= {arXiv preprint arXiv:2401.09413},
year = {2024}
}
备注
accepted to NeurIPS 2023