中文

使用深度生成模型的低带宽视频聊天压缩

计算机视觉与模式识别 2020-12-02 v1 机器学习

摘要

为使数以亿计受限于网络连接差或数据费用高昂的人能够使用视频聊天,我们提出在接收端利用发送端提取并经由网络传输的面部关键点来真实重建人脸。在此背景下,我们讨论并评估了几种深度对抗方法的优劣。特别地,我们探讨了基于静态关键点、动态关键点或分割图的方案在质量与带宽上的权衡。我们基于 Siarohin 等人的一阶动画模型设计了兼容移动的架构。此外,我们利用 SPADE 块在眼睛和嘴唇等重要区域优化结果。我们将网络压缩至约 3MB,使模型能在 iPhone 8(CPU)上实时运行。该方法以每秒数 kbit 的速率实现视频通话,比现有替代方案低一个数量级。

关键词

引用

@article{arxiv.2012.00328,
  title  = {Low Bandwidth Video-Chat Compression using Deep Generative Models},
  author = {Maxime Oquab and Pierre Stock and Oran Gafni and Daniel Haziza and Tao Xu and Peizhao Zhang and Onur Celebi and Yana Hasson and Patrick Labatut and Bobo Bose-Kolanu and Thibault Peyronel and Camille Couprie},
  journal= {arXiv preprint arXiv:2012.00328},
  year   = {2020}
}

备注

11 pages