中文

面向学习型视频压缩的时间上下文挖掘

计算机视觉与模式识别 2023-01-31 v2 机器学习 图像与视频处理

摘要

我们研究端到端学习型视频压缩,特别关注更好地学习和利用时间上下文。对于时间上下文挖掘,我们提出不仅将先前重建的帧,还将传播特征存储到广义解码图像缓冲区中。从存储的传播特征中,我们提出学习多尺度时间上下文,并将所学时间上下文重新填充到我们压缩方案的模块中,包括上下文编码器-解码器、帧生成器以及时间上下文编码器。我们的方案摒弃了不利于并行化的自回归熵模型,以追求更实用的解码时间。我们将我们的方案与 x264 和 x265(分别代表 H.264 和 H.265 的工业软件)以及 H.264、H.265 和 H.266 的官方参考软件(分别为 JM、HM 和 VTM)进行比较。当帧内周期为 32 且面向 PSNR 时,我们的方案比 H.265–HM 节省 14.4% 的比特率;当面向 MS-SSIM 时,我们的方案比 H.266–VTM 节省 21.1% 的比特率。

关键词

引用

@article{arxiv.2111.13850,
  title  = {Temporal Context Mining for Learned Video Compression},
  author = {Xihua Sheng and Jiahao Li and Bin Li and Li Li and Dong Liu and Yan Lu},
  journal= {arXiv preprint arXiv:2111.13850},
  year   = {2023}
}