中文

RT-NeRV:通过残差标记化重新思考视频的混合神经表示

计算机视觉与模式识别 2026-05-25 v2

摘要

视频神经表示(NeRV)作为一种有前景的视频压缩范式而出现,它将视频表示为具有高效解码能力的紧凑神经网络。混合 NeRV 方法通过内容自适应嵌入进一步提高了重建质量,但在低比特率下仍难以保留精细细节。一个关键限制是,浅层残差支持信息虽然对重建非常有益,但以其连续形式传输代价高昂,因此未得到充分利用。本文中,我们重新思考混合 NeRV,并提出 RT-NeRV,一种用于混合神经视频表示的残差标记化框架。其核心思想是将浅层残差特征和帧间残差线索离散化为紧凑的残差标记,使信息丰富的重建支持得以高效传输并被解码器利用。为此,我们设计了一个残差标记器以及一种残差感知码本学习策略,以提高标记利用率并稳定训练。RT-NeRV 可以轻松集成到现代混合 NeRV 主体中,持续增强细节保留、重建质量和比特率质量权衡。在视频回归和相关恢复任务上的大量实验表明,RT-NeRV 优于强大的混合 NeRV 基线,并保持与近期基于 INR 的视频压缩方法的竞争力。这些结果证明,残差标记化是推进混合神经视频表示的一个有效且互补的方向。

关键词

引用

@article{arxiv.2403.12401,
  title  = {RT-NeRV: Rethinking Hybrid Neural Representations for Video via Residual Tokenization},
  author = {Yunjie Xu and Xiang Feng and Chengkai Wang and Alan Wee-Chung Liew and Xuefei Yin and Yanming Zhu},
  journal= {arXiv preprint arXiv:2403.12401},
  year   = {2026}
}

备注

Under Review