中文

ELF-VC:高效学习型灵活码率视频编码

图像与视频处理 2021-10-06 v1 人工智能 计算机视觉与模式识别 机器学习

摘要

尽管学习型视频编解码器已展现出巨大前景,但其尚未达到实际部署所需的效率。在这项工作中,我们提出了若干用于学习视频压缩的新颖思路,可在低延迟模式(仅 I 帧和 P 帧)下提升性能,并大幅提高计算效率。在此设定下,对于自然视频,我们的方法在 PSNR、MS-SSIM 和 VMAF 指标上相对于所有主流视频标准(H.264、H.265、AV1)及所有 ML 编解码器在整个率失真(R-D)曲线上均具优势。同时,我们的方法运行速度至少比所有报告了这些数据的 ML 编解码器快 5 倍,且参数更少。我们的贡献包括:一个灵活码率框架,使单一模型能以可忽略的计算与参数增长覆盖大而密集的码率范围;一个针对基于 ML 的编解码器优化的高效骨干网络;以及一种利用先验信息实现更高效压缩的新型环内光流预测方案。我们在流行视频测试集 UVG 和 MCL-JCV 上,以 PSNR、MS-SSIM 和 VMAF 指标对我们称为 ELF-VC(高效、学习型、灵活视频编码)的方法进行了基准测试。例如,在 UVG 上基于 PSNR,相对于 H.264 其 BD-rate 降低 44%,相对于 H.265 降低 26%,相对于 AV1 降低 15%,相对于当前最佳 ML 编解码器降低 35%。同时,在 NVIDIA Titan V GPU 上,我们的方法对 VGA 编码/解码为 49/91 FPS,HD 720 为 19/35 FPS,HD 1080 为 10/18 FPS。

关键词

引用

@article{arxiv.2104.14335,
  title  = {ELF-VC: Efficient Learned Flexible-Rate Video Coding},
  author = {Oren Rippel and Alexander G. Anderson and Kedar Tatwawadi and Sanjay Nair and Craig Lytle and Lubomir Bourdev},
  journal= {arXiv preprint arXiv:2104.14335},
  year   = {2021}
}