中文

MOVIS:增强室内场景的多目标新视角合成

计算机视觉与模式识别 2025-03-25 v2

摘要

利用预训练的扩散模型已被证明对NVS有效。然而,这些方法大多局限于单个物体;直接将此类方法应用于组合多目标场景会产生较差的结果,尤其是在新视角下物体放置错误以及形状和外观不一致。如何增强并系统评估此类模型的跨视角一致性仍待探索。为解决此问题,我们提出MOVIS,从模型输入、辅助任务和训练策略三个方面增强视图条件扩散模型对多目标NVS的结构感知能力。首先,我们将结构感知特征(包括深度和物体掩码)注入去噪U-Net,以增强模型对物体实例及其空间关系的理解。其次,我们引入一个辅助任务,要求模型同时预测新视角的物体掩码,进一步提升模型区分和放置物体的能力。最后,我们对扩散采样过程进行深入分析,并在训练过程中精心设计了一个结构引导的时间步采样调度器,以平衡全局物体放置学习和细粒度细节恢复。为系统评估合成图像的合理性,我们提出在现有图像级NVS指标之外,评估跨视角一致性和新视角物体放置。在具有挑战性的合成和真实数据集上的大量实验表明,我们的方法展现出强大的泛化能力,并生成一致的新视角合成结果,突显了其指导未来3D感知多目标NVS任务的潜力。我们的项目页面位于https://jason-aplp.github.io/MOVIS/。

关键词

引用

@article{arxiv.2412.11457,
  title  = {MOVIS: Enhancing Multi-Object Novel View Synthesis for Indoor Scenes},
  author = {Ruijie Lu and Yixin Chen and Junfeng Ni and Baoxiong Jia and Yu Liu and Diwen Wan and Gang Zeng and Siyuan Huang},
  journal= {arXiv preprint arXiv:2412.11457},
  year   = {2025}
}

备注

Accepted by CVPR 2025. Project page: https://jason-aplp.github.io/MOVIS/