中文

基于时空 Transformer 的视频压缩框架

图像与视频处理 2023-09-22 v1 计算机视觉与模式识别 多媒体

摘要

近年来,学习型视频压缩(LVC)取得了显著进展。与传统视频编码类似,LVC 继承了运动估计/补偿、残差编码等模块,且均以神经网络(NNs)实现。然而,在神经网络框架及其基于梯度反向传播的训练机制下,大多数现有工作往往难以从输入颜色特征中稳定地生成以几何特征形式存在的运动信息。此外,帧间预测与残差编码等模块彼此独立,难以高效充分地去除时空冗余。为解决上述问题,本文提出一种新颖的基于时空 Transformer 的视频压缩(STT-VC)框架。它包含用于运动估计与补偿的带 Uformer 偏移估计的松弛可变形 Transformer(RDT)、基于多参考帧的预测精化的多粒度预测(MGP)模块,以及基于空间特征分布先验的 Transformer(SFD-T)用于高效的时空联合残差压缩。具体而言,RDT 通过深入探究基于相似度的几何运动特征提取与自注意力之间的关系,稳定估计帧间运动信息。MGP 旨在利用编码运动信息生成的粗粒度预测特征,有效融合多参考帧信息。SFD-T 通过联合探索残差与时空预测中的空间特征分布来压缩残差信息,进一步降低时空冗余。实验结果表明,我们的方法取得了最佳结果,相较 VTM 节省 13.5% 的 BD-Rate。

关键词

引用

@article{arxiv.2309.11913,
  title  = {Spatial-Temporal Transformer based Video Compression Framework},
  author = {Yanbo Gao and Wenjia Huang and Shuai Li and Hui Yuan and Mao Ye and Siwei Ma},
  journal= {arXiv preprint arXiv:2309.11913},
  year   = {2023}
}