FreeScene:基于自由提示的混合图扩散 3D 场景合成
计算机视觉与模式识别
2025-06-04 v1
摘要
可控性在 3D 室内场景合成的实际应用中起着至关重要的作用。现有的工作要么允许粗略的基于语言的控制,这很方便但缺乏细粒度的场景定制;要么采用基于图的控制,这提供了更好的可控性,但在繁琐的图设计过程中需要大量知识。为了应对这些挑战,我们提出了 FreeScene,一个用户友好的框架,可为室内场景合成提供既方便又有效的控制。具体而言,FreeScene 支持自由格式的用户输入,包括文本描述和/或参考图像,允许用户表达多样化的设计意图。用户输入由基于 VLM 的图设计器进行充分分析并整合为图表示。然后,我们提出了 MG-DiT,一种混合图扩散 Transformer,它执行图感知去噪以增强场景生成。我们的 MG-DiT 不仅擅长保留图结构,而且对各种任务具有广泛的适用性,包括但不限于文本到场景、图到场景和重新排列,所有这些都在单一模型内完成。大量实验表明,FreeScene 提供了一个高效且用户友好的解决方案,统一了基于文本和基于图的场景合成,在一系列应用的生成质量和可控性方面均优于最先进的方法。
引用
@article{arxiv.2506.02781,
title = {FreeScene: Mixed Graph Diffusion for 3D Scene Synthesis from Free Prompts},
author = {Tongyuan Bai and Wangyuanfan Bai and Dong Chen and Tieru Wu and Manyi Li and Rui Ma},
journal= {arXiv preprint arXiv:2506.02781},
year = {2025}
}
备注
Accepted to CVPR 2025