3DEgo:随身进行 3D 编辑!
计算机视觉与模式识别
2024-07-16 v1
摘要
我们引入 3DEgo 以解决一个新问题:从单目视频中 guided by 文本提示直接合成逼真的 3D 场景。传统方法通过三个阶段构建文本条件 3D 场景:使用 Structure-from-Motion(SfM)库如 COLMAP 进行姿态估计,用未编辑的图像初始化 3D 模型,并通过编辑后的图像迭代更新数据集以实现具有文本保真度的 3D 场景。我们的框架通过克服对 COLMAP 的依赖,消除模型初始化的成本,将传统的多阶段 3D 编辑流程整合为单阶段工作流程。我们应用扩散模型在 3D 场景创建之前编辑视频帧,通过设计的噪声混合模块提高多视角编辑一致性,该步骤无需额外训练或微调 T2I 扩散模型。3DEgo 利用 3D 高斯溅射创建来自多视角一致编辑帧的 3D 场景,充分利用其内在的时序连续性和显式点云数据。3DEgo 在六个数据集上 demonstration 出卓越的编辑精度、速度和适应性,其中包括我们自制的 GS25 数据集。项目页面:https://3dego.github.io/
引用
@article{arxiv.2407.10102,
title = {3DEgo: 3D Editing on the Go!},
author = {Umar Khalid and Hasan Iqbal and Azib Farooq and Jing Hua and Chen Chen},
journal= {arXiv preprint arXiv:2407.10102},
year = {2024}
}
备注
ECCV 2024 Accepted Paper