中文

利用合成说话头压缩视频通话

计算机视觉与模式识别 2022-10-10 v1

摘要

我们利用说话头生成领域的最新进展,提出了一种用于说话头视频压缩的端到端系统。我们的算法间歇性地传输关键帧(pivot frames),而其余的说话头视频通过对关键帧进行动画化生成。我们使用最先进的面部重演(face reenactment)网络来检测非关键帧中的关键点,并将其传输给接收端。随后计算稠密光流(dense flow)以对关键帧进行扭曲(warp),从而重建非关键帧。传输关键点而非完整帧可带来显著的压缩效果。我们提出了一种新颖的算法,以固定间隔自适应地选择最合适的关键帧,从而提供流畅的体验。我们还提出了接收端处的帧插值器(frame-interpolater)以进一步提高压缩水平。最后,一个面部增强网络改善了重建质量,显著提升了生成结果的清晰度等多个方面。我们在基准数据集上对我们的方法进行了定性与定量评估,并与多种压缩技术进行了比较。我们在 https://cvit.iiit.ac.in/research/projects/cvit-projects/talking-video-compression 发布了演示视频和补充信息。

关键词

引用

@article{arxiv.2210.03692,
  title  = {Compressing Video Calls using Synthetic Talking Heads},
  author = {Madhav Agarwal and Anchit Gupta and Rudrabha Mukhopadhyay and Vinay P. Namboodiri and C V Jawahar},
  journal= {arXiv preprint arXiv:2210.03692},
  year   = {2022}
}

备注

British Machine Vision Conference (BMVC), 2022