面向内存高效神经视频压缩的统一自回归框架 UAR-NVC
计算机视觉与模式识别
2025-09-11 v2 人工智能
摘要
隐式神经表示 (INR) 在视频压缩中已显示出巨大的潜力,通过将视频表示为神经网络来实现压缩。然而,随着帧数的增加,训练和推理的内存消耗会显著增加,这在资源受限的场景中提出了挑战。灵感来自传统视频压缩框架,这些框架逐帧处理视频,能够高效压缩长视频,我们采纳了这种建模策略用于 INR,以降低内存消耗,同时旨在从时间线基准的自回归建模视角实现框架的统一。在本工作中,我们从自回归 (AR) 的角度提出了一种对 INR 模型的新颖理解,引入了面向内存高效神经视频压缩的统一自回归框架 (UAR-NVC)。UAR-NVC 将基于时间线的 INR 视频压缩与 INR 视频压缩集成在统一的自回归范式下。它将视频划分为多个片段,对每个片段使用不同的 INR 模型实例进行处理,利用两种压缩框架的优势,同时允许无缝适应两种压缩形式。为进一步减少片段之间的时序冗余,我们设计了两个模块来优化这些模型参数的初始化、训练和压缩。UAR-NVC 通过可变更的片段长度支持可调延迟。大量实验结果表明,UAR-NVC 凭借其灵活的视频片段设置,能够适应资源受限的环境,并显著优于不同基线模型。项目页面: "https://wj-inf.github.io/UAR-NVC-page/"。
引用
@article{arxiv.2503.02733,
title = {UAR-NVC: A Unified AutoRegressive Framework for Memory-Efficient Neural Video Compression},
author = {Jia Wang and Xinfeng Zhang and Gai Zhang and Jun Zhu and Lv Tang and Li Zhang},
journal= {arXiv preprint arXiv:2503.02733},
year = {2025}
}
备注
Accepted to TCSVT2025