中文

ExCap3D:基于对象标述的具备可变细节的3D场景表达能力

计算机视觉与模式识别 2025-03-24 v1

摘要

生成3D室内场景中物体的文本描述是具象化理解的重要基础。现有方法仅以单一细节层级描述物体,往往无法捕捉物体部件纹理、材料和形状等细粒度信息。我们提出了具备可变细节的3D标述任务:给定输入3D场景,对每个物体生成多个细节层级的描述,包括高层次的对象描述以及低层次的部件属性描述。为实现此任务,我们提出ExCap3D模型,该模型输入3D扫描图,对扫描中检测到的每个物体,生成其部件的细粒度集体描述,并基于部件描述生成对象层面的描述。我们设计ExCap3D以鼓励生成文本描述之间的语义一致性,以及潜在空间中的文本相似性,以进一步提升生成描述的质量。为支撑该任务,我们利用视觉语言模型(VLM)实现多视角标述,构建ExCap3D数据集。该数据集包含947个室内场景中34k个3D物体的190k条不同细节层级的文本描述。实验表明,ExCap3D生成的对象级和部件级细节描述质量均优于当前最先进方法,分别提升了17%和124%的Cider得分。我们的代码、数据集和模型将公开释放。

关键词

引用

@article{arxiv.2503.17044,
  title  = {ExCap3D: Expressive 3D Scene Understanding via Object Captioning with Varying Detail},
  author = {Chandan Yeshwanth and David Rozenberszki and Angela Dai},
  journal= {arXiv preprint arXiv:2503.17044},
  year   = {2025}
}

备注

Project page: https://cy94.github.io/excap3d/, Video: https://www.youtube.com/watch?v=SQRV1l_0oY0