中文

PARIS3D: 基于推理的3D部分分割使用大型多模态模型

计算机视觉与模式识别 2024-04-08 v1 人工智能

摘要

近年来3D感知系统的进步显著提高了其执行视觉识别任务(如分割)的能力。然而,这些系统仍然严重依赖显式的人类指令来识别目标对象或类别,缺乏主动推理和理解隐含用户意图的能力。我们引入了一种新的分割任务,称为3D对象的推理部分分割,旨在基于关于3D对象特定部分的复杂隐含文本查询输出分割掩码。为了便于评估和基准测试,我们提供了一个大型3D数据集,包含超过6万条指令及其对应的真实部分分割标注,专门为基于推理的3D部分分割而设计。我们提出了一种模型,能够基于隐含文本查询分割3D对象的部件,并生成与3D对象分割请求对应的自然语言解释。实验表明,我们的方法在使用显式查询的模型中取得了有竞争力的性能,并且额外具备识别部件概念、推理它们以及用世界知识补充它们的能力。我们的源代码、数据集和训练模型可在https://github.com/AmrinKareem/PARIS3D获取。

关键词

引用

@article{arxiv.2404.03836,
  title  = {PARIS3D: Reasoning-based 3D Part Segmentation Using Large Multimodal Model},
  author = {Amrin Kareem and Jean Lahoud and Hisham Cholakkal},
  journal= {arXiv preprint arXiv:2404.03836},
  year   = {2024}
}

备注

14 pages