中文

意图3D:基于人类意图的RGB-D扫描中的3D目标检测

计算机视觉与模式识别 2025-02-19 v3

摘要

在现实场景中,人类会寻找3D世界中的物体以满足日常需求或意图。这启发我们引入3D意图 grounding,这是一种基于人类意图的RGB-D 3D目标检测新任务,例如“我需要一些能支撑我背部的东西”。与此密切相关的是3D视觉 grounding 关注理解人类参考。为实现基于人类意图的检测,依赖人类观察场景,推理出符合其意图的目标(例如“枕头”),最终向AI系统提供参考,例如“沙发上的枕头”。相反,3D意图 grounding 挑战AI代理能够仅凭人类意图自动观察、推理和检测所需目标。为解决这一挑战,我们引入了新的Intent3D数据集,包含44,990个意图文本,关联209个细粒度类别,来自1,042个ScanNet数据集场景。我们还在本基准上建立了几个基于不同语言的3D目标检测模型的基线。最后,我们提出了IntentNet,我们独特的解决方法,旨在解决这一意图驱动的检测问题。它专注于三个关键方面:意图理解、推理以识别对象候选项,以及级联自适应学习,利用不同损失函数在多目标优化中内在的优先级逻辑。项目页面:https://weitaikang.github.io/Intent3D-webpage/

关键词

引用

@article{arxiv.2405.18295,
  title  = {Intent3D: 3D Object Detection in RGB-D Scans Based on Human Intention},
  author = {Weitai Kang and Mengxue Qu and Jyoti Kini and Yunchao Wei and Mubarak Shah and Yan Yan},
  journal= {arXiv preprint arXiv:2405.18295},
  year   = {2025}
}

备注

ICLR 2025