MIDI:单图到 3D 场景生成的多实例扩散
计算机视觉与模式识别
2025-07-18 v3
摘要
本文介绍 MIDI,这是一种用于从单张图像生成组合 3D 场景的新范式。不同于依赖重建或检索技术的现有方法,或使用多阶段逐对象生成的方法,MIDI 将预训练的图像到 3D 对象生成模型扩展为多实例扩散模型,实现同时生成多个 3D 实例并保持准确的空间关系和高度的通用性。其核心,MIDI 包含一种新颖的多实例注意力机制,直接在生成过程中有效捕获对象间的相互作用和空间一致性,无需复杂的多步骤流程。该方法利用部分对象图像和全局场景上下文作为输入,直接建模 3D 生成过程中的对象完成。在训练期间,我们有效地利用有限的场景级数据监督 3D 实例之间的相互作用,同时整合单对象数据进行正则化,从而保持预训练的通用性。MIDI 在图像到场景生成方面实现了最先进的性能,通过在合成数据、真实场景数据和由文本到图像扩散模型生成的风格化场景图像上的评估得到验证。
引用
@article{arxiv.2412.03558,
title = {MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation},
author = {Zehuan Huang and Yuan-Chen Guo and Xingqiao An and Yunhan Yang and Yangguang Li and Zi-Xin Zou and Ding Liang and Xihui Liu and Yan-Pei Cao and Lu Sheng},
journal= {arXiv preprint arXiv:2412.03558},
year = {2025}
}
备注
Project page: https://huanngzh.github.io/MIDI-Page/