中文

面向极端复杂度与质量尺度的高效神经视频表征压缩

图像与视频处理 2026-06-26 v1 计算机视觉与模式识别

摘要

隐式神经表征(INRs)近年来已成为一种有前景的视频压缩方法,在提供具有竞争力的率失真性能的同时实现快速解码。然而,现有的神经视频编解码器难以平衡复杂度与可扩展性。轻量模型在扩展到不同码率/质量级别时往往压缩性能下降,而高性能模型的可扩展性有限,因为其模型复杂度通常随质量提高而增加。缺乏能够在宽码率范围内保持恒定复杂度的统一架构,严重限制了它们在多样化现实场景中的部署。为应对这些挑战,我们提出 NVRC++,一种新颖的基于 INR 的视频编解码器,它利用带有多个高分辨率特征网格的轻量 INR,在任何给定复杂度级别下提供高可扩展性。这配合一种优化框架,能够高效地在长视频序列的高分辨率网格上过拟合,从而在不产生过高计算或内存开销的情况下利用时空冗余。此外,设计了一种先进的熵模型用于高效压缩高维网格参数。因此,NVRC++ 提供四个复杂度级别(从 7kMACs/像素到 360kMACs/像素),每个级别覆盖宽码率和质量范围,同时支持实时解码。实验结果表明,与 SOTA 基于 INR 的视频编解码器 NVRC 相比,NVRC++ 提供快得多的解码速度(高达 7.6 倍),同时取得相当的性能。

关键词

引用

@article{arxiv.2606.28163,
  title  = {Enhanced Neural Video Representation Compression across Extreme Complexity and Quality Scales},
  author = {Ho Man Kwan and Tianhao Peng and Fan Zhang and Mike Nilsson and Andrew Gower and David Bull},
  journal= {arXiv preprint arXiv:2606.28163},
  year   = {2026}
}