中文

深度视频预编码

图像与视频处理 2019-12-17 v2 机器学习 多媒体 机器学习

摘要

若干团队目前正在研究深度学习如何推进图像与视频编码的最先进水平。一个开放性问题是如何使深度神经网络与现有(及即将推出的)视频编解码器协同工作,例如 MPEG AVC、HEVC、VVC、Google VP9 和 AOM AV1,以及现有容器与传输格式,且不在客户端施加任何改动。这种兼容性在实际部署中至关重要,尤其是因为视频内容行业和硬件制造商在可预见的未来预计仍将致力于这些标准。我们提出将深度神经网络用作当前与未来视频编解码器以及自适应视频流系统的预编码器。在当前设计中,核心预编码组件由在视频编码期间、传输前工作的级联降尺度神经网络结构组成。这 coupled 与一个针对每个可独立解码流段的预编码模式选择算法,该算法根据场景特征、所用编码器以及期望码率和编码配置来调整降尺度因子。我们的框架与所有当前和未来编解码器及传输标准兼容,因为我们的深度预编码网络结构与线性上尺度滤波器(如双线性滤波器)联合训练,而后者被所有网页视频播放器支持。使用 FHD 和 UHD 内容以及广泛使用的 AVC、HEVC 和 VP9 编码器的结果表明,在此类适用于视频点播自适应流系统的编码配置和码率下,将此类标准与所提深度视频预编码相结合可实现 15% 至 45% 的码率降低。预编码的使用还可降低编码复杂度,这对于 H.265/HEVC 和 VP9 等复杂编码器在云端的成本效益部署至关重要。

关键词

引用

@article{arxiv.1908.00812,
  title  = {Deep Video Precoding},
  author = {Eirina Bourtsoulatze and Aaron Chadha and Ilya Fadeev and Vasileios Giotsas and Yiannis Andreopoulos},
  journal= {arXiv preprint arXiv:1908.00812},
  year   = {2019}
}

备注

16 pages, 14 figures, 11 tables, to appear in IEEE Trans. Circ. Syst. for Video Technology