神经视频场编辑
计算机视觉与模式识别
2024-03-12 v2
摘要
扩散模型彻底改变了文本驱动的视频编辑。然而,将这些方法应用于真实世界编辑会遇到两个重大挑战:(1)随着帧数增加,GPU内存需求迅速增长;(2)编辑后的视频存在帧间不一致性。为此,我们提出NVEdit,一种新颖的文本驱动视频编辑框架,旨在减轻内存开销并改善真实世界长视频的一致性编辑。具体而言,我们构建了一个由三平面和稀疏网格支持的神经视频场,以内存高效的方式编码数百帧的长视频。接着,我们通过现成的文生图(T2I)模型更新视频场,赋予其文本驱动的编辑效果。我们开发了渐进式优化策略以保留原始时间先验。重要的是,神经视频场和T2I模型都是可适配和可替换的,从而启发未来的研究。实验证明了我们的方法能够编辑数百帧并具有出色的帧间一致性。项目主页:https://nvedit.github.io/。
引用
@article{arxiv.2312.08882,
title = {Neural Video Fields Editing},
author = {Shuzhou Yang and Chong Mou and Jiwen Yu and Yuhan Wang and Xiandong Meng and Jian Zhang},
journal= {arXiv preprint arXiv:2312.08882},
year = {2024}
}