中文

通过扭曲进行动画生成:一种高效的高质量面部表情动画方法

计算机视觉与模式识别 2020-08-04 v1 机器学习 图像与视频处理

摘要

深度神经网络的进展已显著改进了在不借助三维域操作的情况下对静态图像进行动画处理的技术。然而,由于内存限制、训练困难以及缺乏高分辨率(HD)训练数据集,现有方法只能对较小的图像(通常不大于 512x512)进行动画处理,这大大降低了它们在电影制作和交互式系统中的潜在应用价值。受“高分辨率图像可通过向神经网络生成的低分辨率结果添加高频残差来产生”这一思路的启发,我们提出了一种称为 Animating Through Warping(ATW,通过扭曲进行动画生成)的新框架,以实现高效的高分辨率图像动画。具体而言,该框架由两个模块组成:一个新颖的两阶段神经网络生成器和一个称为 Animating Through Warping(ATW)的后处理模块。它仅需要在小图像上训练生成器,并能在任意尺寸的图像上进行推理。在推理过程中,一张高分辨率输入图像被分解为低分辨率分量(128x128)及其对应的高频残差。生成器预测低分辨率结果以及将输入人脸扭曲至期望状态(例如,表情类别或动作单元)的运动场。最后,ResWarp 模块基于运动场对残差进行扭曲,并将扭曲后的残差加到朴素上采样的低分辨率结果上,从而生成最终的高分辨率结果。实验表明了我们方法在生成高分辨率动画方面的有效性和高效性。我们提出的框架成功地对一张 4K 面部图像进行了动画处理,这是此前的神经模型从未实现过的。此外,我们的方法通常能保证生成动画的时间连贯性。源代码将公开可用。

关键词

引用

@article{arxiv.2008.00362,
  title  = {Animating Through Warping: an Efficient Method for High-Quality Facial Expression Animation},
  author = {Zili Yi and Qiang Tang and Vishnu Sanjay Ramiya Srinivasan and Zhan Xu},
  journal= {arXiv preprint arXiv:2008.00362},
  year   = {2020}
}

备注

18 pages, 13 figures, Accepted to ACM Multimedia 2020