基于掩码点-实体对比的开放词汇 3D 场景理解
计算机视觉与模式识别
2025-04-29 v1 计算与语言
摘要
开放词汇 3D 场景理解对于提升物理智能至关重要,因为它使具身智能体能够在动态地解读和与真实环境中的交互。本文引入 MPEC,一种 novel 的 Masked Point-Entity Contrastive learning 方法,用于开放词汇 3D 语义分割,利用 3D 实体-语言对齐和跨不同点云视图的点-实体一致性,以促进实体特定特征表示。我们的方法提高了语义判别能力,增强了唯一实例的区分能力,在 ScanNet 上实现了开放词汇 3D 语义分割的 state-of-the-art 结果,显示出卓越的零样本场景理解能力。在覆盖从低层感知到高层推理任务的 8 个数据集上进行的大规模微调实验表明,所学 3D 特征的潜力,推动了在各种 3D 场景理解任务中的持续性能提升。项目网址: https://mpec-3d.github.io/
引用
@article{arxiv.2504.19500,
title = {Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding},
author = {Yan Wang and Baoxiong Jia and Ziyu Zhu and Siyuan Huang},
journal= {arXiv preprint arXiv:2504.19500},
year = {2025}
}
备注
CVPR 2025