基于文本提示无需重训练的三维场景编辑
计算机视觉与模式识别
2023-12-01 v3
摘要
近来众多扩散模型已被应用于图像合成与编辑。然而,三维场景编辑仍处于早期阶段。其带来诸多挑战,例如需为不同编辑类型设计特定方法、为各种三维场景重训练新模型,以及编辑过程中缺乏便捷的人机交互。为解决这些问题,我们提出一种称为 DN2N 的文本驱动编辑方法,该方法可直接获得具备通用编辑能力的 NeRF 模型,无需重训练。我们的方法利用现成的基于文本的图像编辑模型修改三维场景图像,随后通过过滤过程丢弃破坏三维一致性的编辑不佳图像。接着我们将剩余的不一致性视为去除噪声扰动的问题,可通过生成具有相似扰动特征的训练数据用于训练来解决。我们进一步提出跨视角正则项,以帮助泛化 NeRF 模型缓解这些扰动。我们的文本驱动方法允许用户以其期望的描述编辑三维场景,比先前工作更友好、直观且实用。实验结果表明,我们的方法实现了多种编辑类型,包括但不限于外观编辑、天气转换、材质改变与风格迁移。最重要的是,我们的方法泛化性良好,一组模型参数共享编辑能力,无需针对特定场景定制编辑模型,从而可直接根据用户输人推断带有编辑效果的新视角。项目网站见 https://sk-fun.fun/DN2N
引用
@article{arxiv.2309.04917,
title = {Editing 3D Scenes via Text Prompts without Retraining},
author = {Shuangkang Fang and Yufeng Wang and Yi Yang and Yi-Hsuan Tsai and Wenrui Ding and Shuchang Zhou and Ming-Hsuan Yang},
journal= {arXiv preprint arXiv:2309.04917},
year = {2023}
}
备注
Project Website: https://sk-fun.fun/DN2N