INVE:交互式神经视频编辑
计算机视觉与模式识别
2023-07-18 v1
摘要
我们提出交互式神经视频编辑(INVE),一种实时视频编辑方案,可通过将稀疏帧编辑一致地传播到整个视频片段来辅助视频编辑过程。我们的方法受近期分层神经图集(LNA)工作的启发。然而,LNA 存在两个主要缺陷:(1)该方法对于交互式编辑而言过慢;(2)其对某些编辑用例的支持不足,包括直接帧编辑和刚性纹理跟踪。为应对这些挑战,我们利用并采用由哈希网格编码驱动的高效网络架构,以大幅提升处理速度。此外,我们学习了图像-图集之间的双向函数并引入矢量化编辑,二者共同实现了在图集和帧上直接进行更多样化的编辑。与 LNA 相比,我们的 INVE 将学习和推理时间减少了 5 倍,并支持 LNA 无法实现的多种视频编辑操作。我们通过全面的定量与定性分析展示了 INVE 相对于 LNA 在交互式视频编辑中的优越性,突显其众多优势和性能提升。视频结果请见 https://gabriel-huang.github.io/inve/
引用
@article{arxiv.2307.07663,
title = {INVE: Interactive Neural Video Editing},
author = {Jiahui Huang and Leonid Sigal and Kwang Moo Yi and Oliver Wang and Joon-Young Lee},
journal= {arXiv preprint arXiv:2307.07663},
year = {2023}
}