中文

LEGO-Eval: 通过工具增强实现3D具身环境合成的细粒度评估

计算与语言 2026-01-29 v2

摘要

尽管近期在使用大型语言模型自动生成3D场景方面取得了进展,但生成的场景通常缺乏真实环境中存在的空间布局和物体属性。由于这个问题源于不够详细、粗粒度的指令,因此推进由反映真实环境的更详细、细粒度指令引导的3D场景合成变得至关重要。没有这样的真实场景,在不现实的环境中训练具身智能体可能导致它们学习到与真实世界物理和语义严重偏离的先验知识,从而降低部署时的性能。因此,验证细粒度指令与生成场景之间的一致性对于有效学习至关重要。然而,当前的评估方法,如CLIPScore和视觉语言模型,通常无法可靠地评估这种一致性。这个缺点主要源于它们对3D场景的浅层理解,这常常导致场景组件的不当接地。为了解决这个问题,我们引入了LEGO-Eval,一个配备多种工具的评估框架,旨在显式地接地场景组件,从而实现更准确的一致性评估。我们还提出了LEGO-Bench,一个包含详细指令的基准测试,这些指令指定了真实环境的复杂布局和属性。实验表明,在评估场景-指令一致性方面,LEGO-Eval比VLM-as-a-judge高出0.41的F1分数。使用LEGO-Bench进行基准测试揭示了当前生成方法的显著局限性。在所有评估的方法中,生成完全符合细粒度指令的场景的成功率最多达到10%。

关键词

引用

@article{arxiv.2511.03001,
  title  = {LEGO-Eval: Towards Fine-Grained Evaluation on Synthesizing 3D Embodied Environments with Tool Augmentation},
  author = {Gyeom Hwangbo and Hyungjoo Chae and Minseok Kang and Hyeonjong Ju and Soohyun Oh and Jinyoung Yeo},
  journal= {arXiv preprint arXiv:2511.03001},
  year   = {2026}
}