中文

Gemino:面向视频会议的实用且鲁棒的神经网络压缩方法

网络与互联网体系结构 2023-10-23 v4 计算机视觉与模式识别

摘要

当网络状况恶化时,视频会议系统因当前视频编解码器无法在极低码率下工作而用户体验不佳。近来,已有若干神经替代方案被提出,其利用每帧的稀疏表示(如面部关键点信息)在极低码率下重建说话人头视频。然而,这些方法在通话过程中存在大幅运动或遮挡的场景下重建效果差,且无法扩展到更高分辨率。我们设计了 Gemino,一种基于新型高频条件超分辨率流水线的视频会议神经压缩系统。Gemino 对每帧目标帧的极低分辨率版本进行上采样,同时基于从单张高分辨率参考图像提取的信息增强高频细节(如皮肤纹理、头发等)。我们采用多尺度架构,以不同分辨率运行模型的不同组件,使其可扩展至接近 720p 的分辨率,并且我们对模型进行个性化以学习每个人的特定细节,从而在低码率下实现更佳保真度。我们在 WebRTC 的开源 Python 实现 aiortc 之上实现了 Gemino,并展示其在 Titan X GPU 上以实时处理 1024x1024 视频,且在相同感知质量下比传统视频编解码器降低 2.2-5 倍码率。

关键词

引用

@article{arxiv.2209.10507,
  title  = {Gemino: Practical and Robust Neural Compression for Video Conferencing},
  author = {Vibhaalakshmi Sivaraman and Pantea Karimi and Vedantha Venkatapathy and Mehrdad Khani and Sadjad Fouladi and Mohammad Alizadeh and Frédo Durand and Vivienne Sze},
  journal= {arXiv preprint arXiv:2209.10507},
  year   = {2023}
}

备注

13 pages, 5 appendix