PLA:语言驱动的开放词汇 3D 场景理解
计算机视觉与模式识别
2023-03-23 v2
摘要
开放词汇场景理解旨在定位并识别标注标签空间之外的未见类别。近期 2D 开放词汇感知的突破很大程度上得益于包含丰富词汇概念的互联网级图文配对数据。然而,由于无法获取大规模 3D-文本配对数据,这一成功无法直接迁移至 3D 场景。为此,我们提出通过对 3D 的多视图图像进行描述生成,来蒸馏预训练视觉-语言 (VL) 基础模型中编码的知识,从而显式地将 3D 与语义丰富的描述关联起来。此外,为了促进从描述中学习由粗到细的视觉-语义表征,我们利用 3D 场景与多视图图像间的几何约束,设计了层次化的 3D-描述配对。最后,通过采用对比学习,模型学习到了连接 3D 与文本的语言感知嵌入,以用于开放词汇任务。在开放词汇语义分割和实例分割任务中,我们的方法不仅以 25.8% 44.7% hIoU 和 14.5% 50.4% hAP 的显著优势超越基线方法,还在极具挑战性的零样本域迁移任务中展现出稳健的迁移能力。详见项目网站 https://dingry.github.io/projects/PLA。
引用
@article{arxiv.2211.16312,
title = {PLA: Language-Driven Open-Vocabulary 3D Scene Understanding},
author = {Runyu Ding and Jihan Yang and Chuhui Xue and Wenqing Zhang and Song Bai and Xiaojuan Qi},
journal= {arXiv preprint arXiv:2211.16312},
year = {2023}
}
备注
CVPR2023