中文

基于文本的神经视频操纵中内容与运动的解耦

计算机视觉与模式识别 2022-11-08 v1

摘要

赋予机器从语言描述中想象可能的新物体或场景并生成其逼真渲染的能力,可以说计算机视觉中最具挑战性的问题之一。深度生成模型的最新进展催生了朝此目标取得可喜结果的新方法。在本文中,我们提出一种称为 DiCoMoGAN 的新方法,用于通过自然语言操纵视频,旨在对视频片段进行局部和语义编辑以改变感兴趣物体的外观。我们的 GAN 架构通过解耦内容与运动以启用可控的语义编辑,从而更好地利用多次观测。为此,我们引入两个紧密耦合的网络:(i)用于构建对运动动态和时间不变内容的简洁理解的表示网络,以及(ii)利用提取的潜在内容表示根据目标描述执行操纵的翻译网络。我们的定性与定量评估表明,DiCoMoGAN 显著优于现有的基于帧的方法,产生时间连贯且语义上更有意义的结果。

关键词

引用

@article{arxiv.2211.02980,
  title  = {Disentangling Content and Motion for Text-Based Neural Video Manipulation},
  author = {Levent Karacan and Tolga Kerimoğlu and İsmail İnan and Tolga Birdal and Erkut Erdem and Aykut Erdem},
  journal= {arXiv preprint arXiv:2211.02980},
  year   = {2022}
}