基于分层时序神经表示的视频压缩
计算机视觉与模式识别
2026-01-27 v1
摘要
视频压缩最近受益于隐式神经表示(INRs),这些表示将视频建模为连续函数。INRs提供紧凑的存储和灵活的重建,为传统编解码器提供了有前景的替代方案。然而,大多数现有的基于INR的方法将时间维度视为独立输入,限制了其捕捉复杂时序依赖性的能力。为此,我们提出一种面向视频的分层时序神经表示,即TeNeRV。TeNeRV通过两个关键组件整合短期和长期依赖性。首先,跨帧特征融合(IFF)模块聚合相邻帧的特征,强制局部时序一致性并捕捉细粒度运动。其次,GoP自适应调制(GAM)机制将视频划分为图像组(GoP),并学习组特定的先验。该机制调制网络参数,实现跨不同GoP的自适应表示。大量实验表明,TeNeRV在率失真性能上 consistently 优于现有的INR方法,验证了我们方法的有效性。
引用
@article{arxiv.2601.17743,
title = {Video Compression with Hierarchical Temporal Neural Representation},
author = {Jun Zhu and Xinfeng Zhang and Lv Tang and Junhao Jiang and Gai Zhang and Jia Wang},
journal= {arXiv preprint arXiv:2601.17743},
year = {2026}
}