极度压缩人脸视频的多模态深度复原
计算机视觉与模式识别
2022-03-07 v2 图像与视频处理
信号处理
摘要
可以说,日常视频通信中最常见且最显著的对象是说话头部,如社交媒体、虚拟课堂、远程会议、新闻广播、脱口秀等中所遇到的。当通信带宽受网络拥塞或成本效益限制时,说话头部视频中的压缩伪影不可避免。由于人类视觉系统对人脸的高敏锐度,由此导致的视频质量退化高度可见且令人反感。为解决此问题,我们开发了一种多模态深度卷积神经网络方法,用于复原被极度压缩的人脸视频。主要创新是一种新的 DCNN 架构,它融合了多种模态的已知先验:与视频同步的语音信号以及压缩码流的语义元素,包括运动向量、编码分区图和量化参数。这些先验与潜在视频强相关,因此能够增强深度学习去除压缩伪影的能力。我们给出了充分的经验证据,以验证所提 DCNN 方法在人脸视频上优于现有最优方法。
引用
@article{arxiv.2107.05548,
title = {Multi-modality Deep Restoration of Extremely Compressed Face Videos},
author = {Xi Zhang and Xiaolin Wu},
journal= {arXiv preprint arXiv:2107.05548},
year = {2022}
}
备注
Accepted by TPAMI. Extension of DAVD-Net in CVPR 2020