中文

HOG-Layout:基于视觉-语言模型的分层式 3D 场景生成、优化与编辑

计算机视觉与模式识别 2026-04-14 v1

摘要

3D 布局生成与编辑在具身 AI 和沉浸式 VR 交互中起着至关重要的作用。然而,手动创建需要繁琐的劳动,而数据驱动的生成往往缺乏多样性。大型模型的出现为 3D 场景合成带来了新的可能性。我们提出了 HOG-Layout,它能够利用大型语言模型(LLMs)和视觉-语言模型(VLMs)实现文本驱动的分层场景生成、优化和实时场景编辑。HOG-Layout 通过检索增强生成(RAG)技术提高了场景的语义一致性和合理性,引入了一个优化模块以增强物理一致性,并采用分层表示来增强推理和优化,从而实现实时编辑。实验结果表明,与现有基线相比,HOG-Layout 能生成更合理的环境,同时支持快速直观的场景编辑。

关键词

引用

@article{arxiv.2604.10772,
  title  = {HOG-Layout: Hierarchical 3D Scene Generation, Optimization and Editing via Vision-Language Models},
  author = {Haiyan Jiang and Deyu Zhang and Dongdong Weng and Weitao Song and Henry Been-Lirn Duh},
  journal= {arXiv preprint arXiv:2604.10772},
  year   = {2026}
}

备注

CVPR 2026