Free-Editor:零样本文本驱动的3D场景编辑
计算机视觉与模式识别
2024-07-16 v2
摘要
文本到图像(T2I)扩散模型最近因其在2D内容生成和编辑中的多功能性和用户友好性而受到关注。然而,专门为3D场景编辑训练扩散模型由于缺乏大规模数据集而具有挑战性。目前,编辑3D场景需要重新训练模型以适应各种3D编辑,或者为每种独特的编辑类型开发特定方法。此外,最先进(SOTA)技术需要来自同一场景的多张同步编辑图像才能实现有效的场景编辑。鉴于当前T2I模型的局限性,在多张图像上实现一致的编辑效果仍然困难,导致编辑中的多视图不一致。当这些图像被用于3D场景编辑时,这种不一致性会损害编辑性能。在本研究中,我们介绍了一种新颖的、无需训练的3D场景编辑技术,称为\textsc{Free-Editor},它使用户能够在测试阶段无需模型重新训练即可编辑3D场景。我们的方法通过实施单视图编辑方案,有效解决了最先进方法中存在的多视图风格不一致问题。具体来说,我们证明了编辑特定3D场景可以通过仅修改单个视图来实现。为此,我们提出了一种编辑变换器(Edit Transformer),它分别使用自视图和交叉视图注意力机制确保视图内一致性和视图间风格迁移。通过消除模型重新训练和多视图编辑的需要,我们的方法显著减少了编辑时间和内存资源需求,运行速度比SOTA方法快约20倍。我们在各种基准数据集上进行了大量实验,展示了我们提出的技术的多样化编辑能力。
引用
@article{arxiv.2312.13663,
title = {Free-Editor: Zero-shot Text-driven 3D Scene Editing},
author = {Nazmul Karim and Hasan Iqbal and Umar Khalid and Jing Hua and Chen Chen},
journal= {arXiv preprint arXiv:2312.13663},
year = {2024}
}
备注
Accepted to ECCV 2024