LRConv-NeRV:用于高效神经视频压缩的低秩卷积
计算机视觉与模式识别
2026-03-20 v1 人工智能
摘要
神经视频表示(NeRV)将整个视频序列编码为神经网络参数,提供了对传统视频编解码器的另一种范式。然而,NeRV 的卷积解码器仍然计算密集且占用大量内存,限制了其在资源受限环境中的部署。本文提出了 LRConv-NeRV,一种高效 NeRV 变体,通过替换选取的稠密 3x3 卷积层为结构化低秩分离卷积,在解码器架构中进行端到端训练。通过从最大的解码器阶段逐步应用低秩分解,LRConv-NeRV 实现了重建质量与效率之间的可控权衡。大量实验表明,仅对最终解码器阶段应用 LRConv 可将解码器复杂度降低 68%,从 201.9 降至 64.9 GFLOPs,模型大小降低 9.3%,同时几乎不损失质量,并实现约 9.2% 的比特率降低。在 INT8 后训练量化下,LRConv-NeRV 保持重建质量接近稠密 NeRV 基线,而更激进的早期解码器阶段分解则导致质量损失不成比例。与现有工作在层对齐设置下相比,LRConv-NeRV 在效率与质量之间实现了更有利的权衡,在保持更高 PSNR/MS-SSIM 和改进的时序稳定性的同时,显著减少了 GFLOPs 和参数量。使用 LPIPS 进行时序闪烁分析进一步表明,所提出的解决方案在保持接近 NeRV 基线的时序一致性方面表现出色。结果表明,LRConv-NeRV 作为高效神经视频解码在低精度和资源受限环境下的具有前景的架构替代方案。
引用
@article{arxiv.2603.18261,
title = {LRConv-NeRV: Low Rank Convolution for Efficient Neural Video Compression},
author = {Tamer Shanableh},
journal= {arXiv preprint arXiv:2603.18261},
year = {2026}
}
备注
This work has been submitted to the IEEE for possible publication