中文

通过 3D 高斯溅写重建视频以增强视频编辑的时间一致性

计算机视觉与模式识别 2025-04-08 v4

摘要

最近的零样文本驱动视频扩散模型在实现文本驱动视频编辑方面取得了一些进展,但仍面临如何实现高时间一致性的挑战。为此,我们引入了 Video-3DGS,一种基于 3D 高斯溅写(3DGS)的视频细化器,旨在增强零样视频编辑器的时间一致性。我们的方法针对编辑动态单目视频设计了两个阶段的 3D 高斯优化过程。在第一个阶段,Video-3DGS 使用改进版的 COLMAP(称为 MC-COLMAP),采用掩码和裁剪方法处理原始视频。对于每个视频片段,MC-COLMAP 生成动态前景对象和复杂背景的点云。这些点云用于初始化两个 3D 高斯集合(Frg-3DGS 和 Bkg-3DGS),旨在分别表示前景和背景视图。随后,将前景和背景视图与 2D 可学习参数图合并,以重建完整视图。在第二个阶段,我们利用第一个阶段开发的重建能力,对视频扩散模型施加时间约束。为证明 Video-3DGS 在两个阶段上的有效性,我们在两个相关任务上进行了广泛实验:视频重建和视频编辑。在 DAVIS 数据集上,进行 3k 次迭代训练的 Video-3DGS 在 PSNR 上分别比基于 NeRF 和基于 3DGS 的最先进方法提升 3 和 7 个单位,在训练效率上分别快 1.9 倍和 4.5 倍。此外,它在 58 个动态单目视频上实现了视频编辑的增强,确保了时间一致性。

关键词

引用

@article{arxiv.2406.02541,
  title  = {Enhancing Temporal Consistency in Video Editing by Reconstructing Videos with 3D Gaussian Splatting},
  author = {Inkyu Shin and Qihang Yu and Xiaohui Shen and In So Kweon and Kuk-Jin Yoon and Liang-Chieh Chen},
  journal= {arXiv preprint arXiv:2406.02541},
  year   = {2025}
}

备注

Accepted to TMLR 2025. Project page at https://video-3dgs-project.github.io/