中文

FirePlace:面向 3D 物体放置的 LLM 常识推理几何精化

计算机视觉与模式识别 2025-03-10 v1

摘要

利用 3D 资产进行场景生成是一项复杂挑战,需要高层语义理解与底层几何推理的结合。虽然多模态大语言模型(MLLMs)在语义任务上表现出色,但其应用于 3D 场景生成受到 3D 几何基础薄弱的影响。在本文中,我们研究了如何在物体放置任务中最好地利用 MLLMs。为此,我们提出了一种新框架 FirePlace,该框架利用现有的 MLLMs 进行:(1)3D 几何推理以及从 3D 场景中提取相关几何细节,(2)构建并求解从提取的底层几何中得出的几何约束,以及(3)剪枝以获得符合常识的最终放置。通过将几何推理与 MLLMs 的现实世界理解相结合,我们的方法能够提出同时满足几何约束和高层语义常识考虑的物体放置方案。我们的实验表明,这些能力使我们的方法能够在具有复杂几何的复杂场景中更有效地放置物体,超越先前工作的质量。

关键词

引用

@article{arxiv.2503.04919,
  title  = {FirePlace: Geometric Refinements of LLM Common Sense Reasoning for 3D Object Placement},
  author = {Ian Huang and Yanan Bao and Karen Truong and Howard Zhou and Cordelia Schmid and Leonidas Guibas and Alireza Fathi},
  journal= {arXiv preprint arXiv:2503.04919},
  year   = {2025}
}