中文

PlaceIt3D:面向真实 3D 场景的语言引导对象放置

计算机视觉与模式识别 2025-10-03 v2 人工智能 机器人学

摘要

我们提出了语言引导的真实 3D 场景中对象放置这一新任务。我们的模型给定 3D 场景的点云、一个 3D 资产,以及一个大致描述 3D 资产应放置位置的文本提示。此任务的目标是找到一个满足提示要求的有效放置位置。与其他语言引导的 3D 场景定位任务(如 grounding)相比,该任务具有特定挑战:它是模糊的,因为存在多个有效解,需要推理 3D 几何关系和自由空间。我们提出了一个新的基准和评估协议。我们还提供了一个用于训练 3D LLM 的新数据集,以及作为非平凡基线的首个方法。我们认为,这一具有挑战性的任务和我们的新基准将成为评估和比较通用 3D LLM 模型的基准套件之一。

关键词

引用

@article{arxiv.2505.05288,
  title  = {PlaceIt3D: Language-Guided Object Placement in Real 3D Scenes},
  author = {Ahmed Abdelreheem and Filippo Aleotti and Jamie Watson and Zawar Qureshi and Abdelrahman Eldesokey and Peter Wonka and Gabriel Brostow and Sara Vicente and Guillermo Garcia-Hernando},
  journal= {arXiv preprint arXiv:2505.05288},
  year   = {2025}
}

备注

ICCV 2025. Project page: https://nianticlabs.github.io/placeit3d/