中文

OpenIns3D:用于三维开放词汇实例分割的快照与查找框架

计算机视觉与模式识别 2024-08-13 v5

摘要

在本工作中,我们介绍 OpenIns3D,一种全新的仅以 3D 为输入的 3D 开放词汇场景理解框架。OpenIns3D 框架采用“掩码-快照-查找”方案。“掩码”模块在 3D 点云中学习类别无关的掩码提议,“快照”模块在多个尺度上生成合成场景级图像,并利用 2D 视觉-语言模型提取感兴趣对象,“查找”模块通过搜索“快照”的结果将类别名称分配给所提议的掩码。该方法虽简单,却在广泛的 3D 开放词汇任务上实现了最先进性能,包括室内与室外数据集上的识别、目标检测和实例分割。此外,OpenIns3D 便于在不同 2D 检测器间无缝切换而无需重新训练。当与强大的 2D 开放世界模型集成时,其在场景理解任务中取得优异结果。进一步,当与 LLM 驱动的 2D 模型结合时,OpenIns3D 展现出理解并处理需复杂推理与真实世界知识的高度复杂文本查询的令人印象深刻的能力。项目主页:https://zheninghuang.github.io/OpenIns3D/

关键词

引用

@article{arxiv.2309.00616,
  title  = {OpenIns3D: Snap and Lookup for 3D Open-vocabulary Instance Segmentation},
  author = {Zhening Huang and Xiaoyang Wu and Xi Chen and Hengshuang Zhao and Lei Zhu and Joan Lasenby},
  journal= {arXiv preprint arXiv:2309.00616},
  year   = {2024}
}

备注

ECCV 2024. Project page: https://zheninghuang.github.io/OpenIns3D/