中文

稀疏3DPR:从稀疏RGB视图训练自由的3D层次化场景解析与任务适应子图推理

计算机视觉与模式识别 2025-11-12 v1 人工智能

摘要

最近,大语言模型 (LLM) 被广泛用于3D 场景理解。其中,训练自由的方法因其灵活性和广泛性而受到关注,但在实际部署中在准确性和效率方面常常受到挑战。为此,我们提出了 Sparse3DPR,一种新的训练自由框架用于开放式场景理解,仅需稀疏 RGB 输入即可利用预训练 LLM 的推理能力。具体,我们引入了层次化平面增强场景图,支持开放词汇表并采用主导平面结构作为空间锚点,这使推理链更清晰且高层推理更可靠。此外,我们设计了任务适应子图提取方法,以动态筛选查询无关信息,减少上下文噪声,提高3D 场景推理效率和准确性。实验结果表明,Sparse3DPR 在 Space3D-Bench 上相较于 ConceptGraphs 实现了 28.7% 的 EM@1 提升和 78.2% 的速度提升。此外,Sparse3DPR 在 ScanQA 上的表现与训练性方法相当,另外的实际实验也确认了其鲁棒性和广泛性。

关键词

引用

@article{arxiv.2511.07813,
  title  = {Sparse3DPR: Training-Free 3D Hierarchical Scene Parsing and Task-Adaptive Subgraph Reasoning from Sparse RGB Views},
  author = {Haida Feng and Hao Wei and Zewen Xu and Haolin Wang and Chade Li and Yihong Wu},
  journal= {arXiv preprint arXiv:2511.07813},
  year   = {2025}
}