中文

基于合成数据集的一致视频到视频迁移

计算机视觉与模式识别 2023-12-04 v3 人工智能

摘要

我们提出了一种新颖且高效的基于文本的视频到视频编辑方法,其消除了对资源密集的逐视频逐模型微调的需求。我们方法的核心是为视频到视频迁移任务量身定制的合成配对视频数据集。受 Instruct Pix2Pix 通过编辑指令进行图像迁移的启发,我们将此范式适配到视频领域。通过将 Prompt-to-Prompt 扩展至视频,我们高效地生成配对样本,每个样本包含输入视频及其编辑对应版本。与此同时,我们在采样期间引入长视频采样校正(Long Video Sampling Correction),以确保跨批次的长视频一致性。我们的方法超越了 Tune-A-Video 等当前方法,在基于文本的视频到视频编辑方面宣告了实质性进展,并指明了令人振奋的进一步探索与部署途径。

关键词

引用

@article{arxiv.2311.00213,
  title  = {Consistent Video-to-Video Transfer Using Synthetic Dataset},
  author = {Jiaxin Cheng and Tianjun Xiao and Tong He},
  journal= {arXiv preprint arXiv:2311.00213},
  year   = {2023}
}