针对说话人头像的跳切平滑处理
计算机视觉与模式识别
2024-01-12 v2
摘要
跳切会给观看体验带来突兀的、有时是不受欢迎的改变。我们提出了一种新颖的框架,用于在说话人头像视频的背景下平滑这些跳切。我们利用视频中其他源帧中主体的外观,将其与由 DensePose 关键点和面部标志驱动的中层表示相融合。为了实现运动,我们在剪切点周围的结束帧之间对关键点和标志进行插值。然后,我们使用一个从关键点和源帧到合成像素的图像翻译网络。由于关键点可能包含错误,我们提出了一种跨模态注意力方案,为每个关键点从多个选项中挑选最合适的源帧。通过利用这种中层表示,我们的方法可以取得比强大的视频插值基线更强的结果。我们在说话人头像视频中的各种跳切上演示了我们的方法,例如剪切填充词、停顿,甚至随机剪切。我们的实验表明,即使在说话人头像在跳切中大幅旋转或移动的挑战性情况下,我们也能实现无缝过渡。
引用
@article{arxiv.2401.04718,
title = {Jump Cut Smoothing for Talking Heads},
author = {Xiaojuan Wang and Taesung Park and Yang Zhou and Eli Shechtman and Richard Zhang},
journal= {arXiv preprint arXiv:2401.04718},
year = {2024}
}
备注
Correct typos in the caption of Figure 1; Change the project website address. Project page: https://jeanne-wang.github.io/jumpcutsmoothing/