面向神经视频编码的自适应与注意力机制
图像与视频处理
2021-12-17 v1 计算机视觉与模式识别
机器学习
摘要
神经图像编码目前代表了最先进的图像压缩方法。然而,在视频领域仍有大量工作有待完成。本文中,我们提出了一种端到端学习的视频编解码器,引入了若干架构与训练上的新设计,围绕自适应与注意力的概念展开。我们的编解码器由一个帧内编解码器与一个帧间编解码器配对组成。作为一项架构创新,我们提出训练帧间编解码器模型以根据输入视频的分辨率自适应运动估计过程。第二项架构创新是一个新的神经模块,它结合了基于 split-attention 的神经网络与 DenseNets 的思想。最后,我们提出在推理时对一组解码器侧乘性参数进行过拟合。通过消融研究以及与已有方法的对比,我们展示了所提技术在编码增益方面的优势。我们将编解码器与代表最先进传统和端到端学习编解码器的 VVC/H.266 和 RLVC,以及与 2021 CLIC 竞赛中表现最优的端到端学习方法 E2E_T_OL 进行比较。我们的编解码器明显优于 E2E_T_OL,并在某些设定下与 VVC 和 RLVC 相比具有竞争力。
引用
@article{arxiv.2112.08767,
title = {Adaptation and Attention for Neural Video Coding},
author = {Nannan Zou and Honglei Zhang and Francesco Cricri and Ramin G. Youvalari and Hamed R. Tavakoli and Jani Lainema and Emre Aksu and Miska Hannuksela and Esa Rahtu},
journal= {arXiv preprint arXiv:2112.08767},
year = {2021}
}