基于 MV-Residual 预测的端到端优化视频压缩
图像与视频处理
2020-05-28 v1 计算机视觉与模式识别
摘要
本文提出了一种可端到端训练的 P 帧压缩框架。设计了一个联合运动向量(MV)与残差预测网络 MV-Residual,通过将连续两帧作为 inputs 来提取运动表示与残差信息的集成特征。潜表示的先验概率由超先验自编码器建模,并与 MV-Residual 网络联合训练。特别地,空间位移卷积被用于视频帧预测,其中为每个像素学习一个运动核,通过在源图像位移位置施加该核来生成预测像素。最后,考虑到比赛的码率约束,采用新颖的码率分配与后处理策略来生成最终压缩码流。验证集上的实验结果表明,所提出的优化框架在 P 帧压缩竞赛中能生成最高的 MS-SSIM。
引用
@article{arxiv.2005.12945,
title = {End-to-end Optimized Video Compression with MV-Residual Prediction},
author = {XiangJi Wu and Ziwen Zhang and Jie Feng and Lei Zhou and Junmin Wu},
journal= {arXiv preprint arXiv:2005.12945},
year = {2020}
}