中文

Chat-Scene++:利用上下文丰富的对象识别实现 3D LLM

计算机视觉与模式识别 2026-04-28 v2

摘要

最近的多模态大语言模型 (MLLM) 在 3D 场景理解方面显示出强大的潜力。然而,现有方法在细粒度对象 grounding 和上下文推理方面存在挑战,限制了其解释和与复杂 3D 环境交互的能力。本文提出了 Chat-Scene++,一种将 3D 场景表示为具有上下文语义的对象序列的 MLLM 框架。通过将场景结构化为具有上下文语义的对象序列,Chat-Scene++ 实现了面向对象的方法化表示和交互。它将 3D 场景分解为配合标识符标记的对象表示,使 LLM 能够在 diverse 3D 视觉-语言任务中遵循指令。为捕获对象间关系和全局语义,Chat-Scene++ 使用大规模预训练的 3D 场景级和 2D 图像级编码器提取上下文丰富的对象特征,不同于 Chat-Scene 中孤立的 per-object 特征。其灵活的对象中心化设计还支持 grounded chain-of-thought (G-CoT) 推理,使模型能够在多步推理期间在类别和空间水平上区分对象。在无需额外任务特定头部或微调的情况下,Chat-Scene++ 在五大主要 3D 视觉-语言基准测试上实现了最先进的性能:ScanRefer、Multi3DRefer、Scan2Cap、ScanQA 和 SQA3D。这些结果凸显了其在场景理解、对象 grounding 和空间推理方面的有效性。此外,在无需通过计算密集型过程重建 3D 世界的情况下,我们仅使用 2D 输入即可演示了其在实际场景中的适用性。

关键词

引用

@article{arxiv.2603.27507,
  title  = {Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM},
  author = {Haifeng Huang and Yilun Chen and Zehan Wang and Jiangmiao Pang and Zhou Zhao},
  journal= {arXiv preprint arXiv:2603.27507},
  year   = {2026}
}