使用语言分割任意 3D 物体
计算机视觉与模式识别
2024-04-03 v1 人工智能
摘要
在本文中,我们研究具有自由形式语言指令的开放词汇 3D 实例分割 (OV-3DIS)。早期仅依赖已标注基类进行训练的工作在对未见新类别的泛化能力上存在局限。近期的工作通过生成类别无关的掩码或将 2D 中的泛化掩码投影到 3D 来缓解对新类别泛化能力差的问题,但忽略了语义或几何信息,导致性能次优。相反,直接从 3D 点云生成具有泛化能力且与语义相关的掩码将产生更优的结果。在本文中,我们引入了使用语言分割任意 3D 物体 (SOLE),这是一个语义与几何感知的视觉-语言学习框架,通过直接从 3D 点云生成与语义相关的掩码而具有很强的泛化能力。具体而言,我们提出了一种多模态融合网络,以在主干网络和解码器中融合多模态语义。此外,为了使 3D 分割模型与各种语言指令对齐并提升掩码质量,我们引入了三种类型的多模态关联作为监督。我们的 SOLE 在 ScanNetv2、ScanNet200 和 Replica 基准测试上大幅优于先前的方法,并且尽管在训练中缺少类别标注,其结果甚至接近全监督的对应方法。此外,广泛的定性结果证明了我们的 SOLE 对语言指令的通用性。
引用
@article{arxiv.2404.02157,
title = {Segment Any 3D Object with Language},
author = {Seungjun Lee and Yuyang Zhao and Gim Hee Lee},
journal= {arXiv preprint arXiv:2404.02157},
year = {2024}
}
备注
Project Page: https://cvrp-sole.github.io