RegionPLC:面向开放世界三维场景理解的区域点-语言对比学习
计算机视觉与模式识别
2024-05-07 v4 人工智能
摘要
我们提出了一种轻量且可扩展的区域点-语言对比学习框架,即\textbf{RegionPLC},用于开放世界三维场景理解,旨在识别并辨认开放集物体与类别。具体而言,基于我们的实证研究,我们引入了一种三维感知的SFusion策略,该策略融合由多个二维基础模型导出的三维视觉-语言对,从而在无人工三维标注的情况下产生高质量、密集的区域级语言描述。随后,我们设计了一个区域感知的点判别对比学习目标,以从密集区域语言监督中实现鲁棒且有效的三维学习。我们在ScanNet、ScanNet200和nuScenes数据集上进行了大量实验,我们的模型在语义和实例分割上分别平均优于先前的三维开放世界场景理解方法17.2%和9.1%,同时保持更强的可扩展性与更低的资源需求。此外,我们的方法具有灵活性,可轻松与语言模型集成,以实现开放式的接地三维推理,无需额外的任务特定训练。代码见 https://github.com/CVMI-Lab/PLA。
引用
@article{arxiv.2304.00962,
title = {RegionPLC: Regional Point-Language Contrastive Learning for Open-World 3D Scene Understanding},
author = {Jihan Yang and Runyu Ding and Weipeng Deng and Zhe Wang and Xiaojuan Qi},
journal= {arXiv preprint arXiv:2304.00962},
year = {2024}
}
备注
To appear in CVPR2024 .project page: https://jihanyang.github.io/projects/RegionPLC