中文

SyncNoise:基于几何一致性的文本化 3D 场景编辑噪声预测

计算机视觉与模式识别 2024-06-26 v1

摘要

文本化 2D 扩散模型在图像生成和编辑方面展现了惊人的能力。同时,2D 扩散模型也在 3D 编辑任务中具有巨大的潜力。然而,如何实现跨多个视角的一致编辑仍是一个挑战。虽然迭代数据更新方法能够实现全局一致性,但 suffers from 速度慢和纹理过于平滑。我们提出 SyncNoise,一种几何引导的多视角一致噪声编辑方法,用于高保真 3D 场景编辑。SyncNoise 在 2D 扩散模型的基础上同步编辑多个视角,同时强制多视角噪声预测几何一致,从而在语义结构和低频外观方面实现全局一致性。为进一步增强高频细节的局部一致性,我们设置一组锚定视角并通过跨视角重投影将其传递给相邻帧。为提高多视角对应关系的可靠性,我们在训练期间引入深度监督以增强精确几何的重建。通过在噪声和像素水平上增强几何一致性,我们的方法能够实现高质量的 3D 编辑结果,尊重文本指令,尤其在纹理复杂的场景中效果显著。

关键词

引用

@article{arxiv.2406.17396,
  title  = {SyncNoise: Geometrically Consistent Noise Prediction for Text-based 3D Scene Editing},
  author = {Ruihuang Li and Liyi Chen and Zhengqiang Zhang and Varun Jampani and Vishal M. Patel and Lei Zhang},
  journal= {arXiv preprint arXiv:2406.17396},
  year   = {2024}
}

备注

16 pages, 13 figures