中文

DreamComposer++:以多视角条件赋能扩散模型用于三维内容生成

计算机视觉与模式识别 2025-07-04 v1

摘要

利用预训练 2D 扩散模型的最新进展实现了从单张自然图像生成高质量新视角。然而,由于缺乏来自多视角的信息,现有工作在生成可控新视角方面面临挑战。在本文中,我们提出了 DreamComposer++,一个灵活且可扩展的框架,旨在通过引入多视角条件来改进当前视角感知扩散模型。具体而言,DreamComposer++ 利用视角感知 3D 提升模块从不同视角提取物体的 3D 表示。这些表示随后通过多视角特征融合模块被聚合并渲染为目标视角的潜在特征。最后,获得的目标视角特征被整合到预训练的图像或视频扩散模型中,用于新视角合成。实验结果表明,DreamComposer++ 能够与最先进的视角感知扩散模型无缝集成,并增强其从多视角条件生成可控新视角的能力。这一进展促进了可控 3D 物体重建,并支持广泛的应用。

关键词

引用

@article{arxiv.2507.02299,
  title  = {DreamComposer++: Empowering Diffusion Models with Multi-View Conditions for 3D Content Generation},
  author = {Yunhan Yang and Shuo Chen and Yukun Huang and Xiaoyang Wu and Yuan-Chen Guo and Edmund Y. Lam and Hengshuang Zhao and Tong He and Xihui Liu},
  journal= {arXiv preprint arXiv:2507.02299},
  year   = {2025}
}

备注

Accepted by TPAMI, extension of CVPR 2024 paper DreamComposer