CaDM:用于神经增强视频流的编解码器感知扩散建模
图像与视频处理
2023-03-09 v2 计算机视觉与模式识别
机器学习
多媒体
摘要
近年来,互联网视频流量急剧增长,其中视频码流常被压缩并以低质量交付以适配推流端的上行带宽。为缓解质量退化,神经增强视频流(NVS)兴起,其通过在媒体服务器上主要部署神经超分辨率(SR)来恢复低质量视频,展现出良好前景。尽管有其优势,我们揭示当前主流的SR增强工作由于以下原因未能实现码率节省与质量恢复之间预期的率失真权衡:(1)过度强调解码端的增强而忽略编码器的协同设计,(2)恢复高保真感知细节的生成能力有限,以及(3)仅从分辨率角度优化压缩-恢复流水线,而未考虑颜色位深。为克服这些局限,我们首次通过利用扩散模型固有的视觉生成属性来进行编码器-解码器(即编解码器,codec)协同。具体而言,我们提出编解码器感知扩散建模(CaDM),一种新颖的NVS范式,可在显著降低流媒体交付码率的同时,相比现有方法具有更高的恢复能力。首先,CaDM通过同时降低视频帧的分辨率和颜色位深来提高编码器的压缩效率。其次,CaDM使解码器具备高质量增强能力,通过使去噪扩散恢复感知编码器的分辨率-颜色条件。在带有OpenMMLab基准的公共云服务上的评估表明,CaDM基于通用视频标准有效节省高达5.12至21.44倍的码率,并比最先进的神经增强方法实现更好的恢复质量(例如FID为0.61)。
引用
@article{arxiv.2211.08428,
title = {CaDM: Codec-aware Diffusion Modeling for Neural-enhanced Video Streaming},
author = {Qihua Zhou and Ruibin Li and Song Guo and Peiran Dong and Yi Liu and Jingcai Guo and Zhenda Xu},
journal= {arXiv preprint arXiv:2211.08428},
year = {2023}
}