中文

NVC-1B:一个大型神经视频编码模型

计算机视觉与模式识别 2024-07-30 v1 图像与视频处理

摘要

大型模型在自然语言处理和计算机视觉领域取得了显著进展。然而,针对神经视频编码的大型模型仍未被探索。本文我们尝试构建大型神经视频编码模型。基于一个小型基线模型,我们逐步扩大其不同编码部分(包括运动编码器-解码器、运动熵模型、上下文编码器-解码器、上下文熵模型和时序上下文挖掘模块)的模型规模,并分析模型规模对视频压缩性能的影响。随后,我们探索使用不同的架构(包括 CNN、混合 CNN-Transformer 和 Transformer 架构)来实现神经视频编码模型,并分析不同架构对视频压缩性能的影响。基于我们的探索结果,我们设计了首个拥有超过 10 亿参数的神经视频编码模型——NVC-1B。实验结果表明,我们提出的大型模型在小型基线模型之上实现了显著的视频压缩性能提升,代表了当前最好的压缩效率。我们预期大型模型可能将视频编码技术提升到下一个水平。

关键词

引用

@article{arxiv.2407.19402,
  title  = {NVC-1B: A Large Neural Video Coding Model},
  author = {Xihua Sheng and Chuanbo Tang and Li Li and Dong Liu and Feng Wu},
  journal= {arXiv preprint arXiv:2407.19402},
  year   = {2024}
}