中文

CoDeF:用于时间一致视频处理的内容形变场

计算机视觉与模式识别 2024-12-13 v2

摘要

我们提出内容形变场 CoDeF 作为一种新型视频表示,其由一个聚合整个视频中静态内容的正则内容场,以及一个记录从正则图像(即由正则内容场渲染而出)沿时间轴到各单独帧的变换的时间形变场组成。给定目标视频,这两个场通过精心定制的渲染流水线联合优化以重建该视频。我们有意地在优化过程中引入一些正则化,促使正则内容场从视频中继承语义(例如物体形状)。借助这样的设计,CoDeF 天然支持将图像算法提升用于视频处理,即可以将某图像算法应用于正则图像,并借助时间形变场轻松将结果传播至整个视频。我们通过实验表明,CoDeF 能够在无任何训练的情况下将图像到图像翻译提升为视频到视频翻译,并将关键点检测提升为关键点跟踪。更重要的是,得益于我们仅在单幅图像上部署算法的提升策略,与现有视频到视频翻译方法相比,我们在处理后的视频中实现了更优的跨帧一致性,甚至能够跟踪水和烟雾等非刚性物体。项目页面见 https://qiuyu96.github.io/CoDeF/。

关键词

引用

@article{arxiv.2308.07926,
  title  = {CoDeF: Content Deformation Fields for Temporally Consistent Video Processing},
  author = {Hao Ouyang and Qiuyu Wang and Yuxi Xiao and Qingyan Bai and Juntao Zhang and Kecheng Zheng and Xiaowei Zhou and Qifeng Chen and Yujun Shen},
  journal= {arXiv preprint arXiv:2308.07926},
  year   = {2024}
}

备注

Project Webpage: https://qiuyu96.github.io/CoDeF/, Code: https://github.com/qiuyu96/CoDeF