中文

基于 MV-Residual 预测的端到端优化视频压缩

图像与视频处理 2020-05-28 v1 计算机视觉与模式识别

摘要

本文提出了一种可端到端训练的 P 帧压缩框架。设计了一个联合运动向量(MV)与残差预测网络 MV-Residual,通过将连续两帧作为 inputs 来提取运动表示与残差信息的集成特征。潜表示的先验概率由超先验自编码器建模,并与 MV-Residual 网络联合训练。特别地,空间位移卷积被用于视频帧预测,其中为每个像素学习一个运动核,通过在源图像位移位置施加该核来生成预测像素。最后,考虑到比赛的码率约束,采用新颖的码率分配与后处理策略来生成最终压缩码流。验证集上的实验结果表明,所提出的优化框架在 P 帧压缩竞赛中能生成最高的 MS-SSIM。

关键词

引用

@article{arxiv.2005.12945,
  title  = {End-to-end Optimized Video Compression with MV-Residual Prediction},
  author = {XiangJi Wu and Ziwen Zhang and Jie Feng and Lei Zhou and Junmin Wu},
  journal= {arXiv preprint arXiv:2005.12945},
  year   = {2020}
}