端到端率失真优化的学习型分层双向视频压缩
图像与视频处理
2021-12-20 v1 计算机视觉与模式识别
摘要
传统的视频压缩(VC)方法基于运动补偿变换编码,由于端到端优化问题的组合性质,运动估计、模式与量化参数选择以及熵编码等步骤是分别优化的。学习型VC允许对非线性变换、运动和熵模型进行端到端率失真(R-D)优化训练。大多数学习型VC的工作考虑基于相邻帧对上平均R-D损失的顺序视频编解码器的端到端优化。在传统VC中众所周知,分层、双向编码由于能够利用过去和未来的参考帧而优于顺序压缩。本文提出一种学习型分层双向视频编解码器(LHBDC),它结合了分层运动补偿预测与端到端优化的优势。实验结果表明,我们在PSNR和MS-SSIM上均取得了迄今报道的学习型VC方案中的最佳R-D结果。与传统视频编解码器相比,我们端到端优化的编解码器的R-D性能在PSNR和MS-SSIM上优于x265和SVT-HEVC编码器(“veryslow”预设),并在MS-SSIM上优于HM 16.23参考软件。我们给出了消融研究,展示了由所提出的新颖工具(如学习型掩码、流场子采样和时域流向量预测)带来的性能增益。模型和复现我们结果的说明可在 https://github.com/makinyilmaz/LHBDC/ 找到。
引用
@article{arxiv.2112.09529,
title = {End-to-End Rate-Distortion Optimized Learned Hierarchical Bi-Directional Video Compression},
author = {M. Akın Yılmaz and A. Murat Tekalp},
journal= {arXiv preprint arXiv:2112.09529},
year = {2021}
}
备注
Accepted for publication in IEEE Transactions on Image Processing on 15 Dec. 2021