中文

JOKR:用于无监督跨域运动重定向的联合关键点表示

计算机视觉与模式识别 2021-06-18 v1

摘要

视频中无监督运动重定向任务通过深度神经网络取得了实质性进展。早期工作集中于特定对象先验(如人脸或人体),近期工作考虑了无监督情形。然而当源视频与目标视频形状不同时,现有方法失效。为缓解该问题,我们提出 JOKR——一种联合关键点表示(JOint Keypoint Representation),可捕捉源视频与目标视频共有的运动,无需任何对象先验或数据收集。通过采用域混淆项,我们强制两视频的无监督关键点表示不可区分,从而鼓励两域共有运动部分与各自外观及运动之间的解耦,能够生成捕捉一方运动而呈现另一方风格的视频。为支持对象比例或朝向不同的情况,我们在 JOKR 间施加学习的仿射变换,使表示具有仿射不变性,并在实践中拓宽可能的重定向配对种类。该几何驱动表示支持进一步的直观控制,如时间一致性与手动编辑。通过综合实验,我们证明了方法适用于不同具有挑战性的跨域视频对,并从定性与定量上评估,表明其处理各类跨域场景(如不同动物、不同花朵及人)。我们还通过统计指标与用户研究,展示了相较最先进替代方法更优的时间一致性与视觉质量。源代码与视频见 https://rmokady.github.io/JOKR/。

关键词

引用

@article{arxiv.2106.09679,
  title  = {JOKR: Joint Keypoint Representation for Unsupervised Cross-Domain Motion Retargeting},
  author = {Ron Mokady and Rotem Tzaban and Sagie Benaim and Amit H. Bermano and Daniel Cohen-Or},
  journal= {arXiv preprint arXiv:2106.09679},
  year   = {2021}
}