中文

TinyNeRV:通过容量缩放、蒸馏与低精度推理实现紧凑型神经视频表示

计算机视觉与模式识别 2026-04-13 v1

摘要

隐式神经视频表示将整个视频序列编码于神经网络参数中,实现恒定时间帧重构。最近的神经视频表示(NeRV)工作已展示出具竞争力的重建性能,避免了传统视频编解码器的顺序解码过程。然而,现有大多数研究聚焦于中等或高容量模型,对于极端紧凑配置的行为仍不足以探讨。本文系统性地研究了面向高效部署的微型 NeRV 架构。引入两种轻量配置:NeRV-T 与 NeRV-T+,并在多个视频数据集上评估,以分析激进的容量缩减对重建质量、计算复杂度和解码吞吐量的影响。除架构缩放外,本文还探讨了在不增加推理成本的情况下提升紧凑模型性能的策略。探索了基于频率感知焦点监督的知识蒸馏,以提高低容量网络的重建保真度。此外,考察了后训练量化和量化感知训练对微型模型在降低数值精度下鲁棒性的影响。实验结果表明,经过精心设计的微型 NeRV 变体能够在显著降低参数数量、计算成本和内存需求的同时,实现有利的质量-效率权衡。这些发现为在资源受限和实时环境中部署 NeRV 类模型提供了指导,并给出了紧凑型神经视频表示的实际极限。官方实现已公开:https://github.com/HannanAkhtar/TinyNeRV-Implementation。

关键词

引用

@article{arxiv.2604.09220,
  title  = {TinyNeRV: Compact Neural Video Representations via Capacity Scaling, Distillation, and Low-Precision Inference},
  author = {Muhammad Hannan Akhtar and Ihab Amer and Tamer Shanableh},
  journal= {arXiv preprint arXiv:2604.09220},
  year   = {2026}
}

备注

Submitted to "Computers and Electrical Engineering", Elsevier