中文

NeRV:面向视频的神经表示

计算机视觉与模式识别 2021-10-27 v1 图像与视频处理

摘要

我们提出一种新颖的视频神经表示(NeRV),将视频编码于神经网络中。不同于将视频视为帧序列的传统表示,我们将视频表示为以帧索引为输入的神经网络。给定帧索引,NeRV 输出对应的 RGB 图像。NeRV 中的视频编码仅是拟合神经网络至视频帧,而解码过程是一次简单的前馈操作。作为一种逐图像的隐式表示,NeRV 输出整幅图像,相较于逐像素隐式表示展现出极高效率,将编码速度提升 25 至 70 倍,解码速度提升 38 至 132 倍,同时获得更好的视频质量。借助此种表示,我们可将视频视为神经网络,从而简化若干视频相关任务。例如,传统视频压缩方法受限于为任务专门设计的冗长复杂流程。相反,使用 NeRV,我们可采用任意神经网络压缩方法作为视频压缩的代理,并取得与传统基于帧的视频压缩方法(H.264、HEVC 等)相当的性能。除压缩外,我们展示了 NeRV 在视频去噪上的泛化能力。源代码与预训练模型可在 https://github.com/haochen-rye/NeRV.git 找到。

关键词

引用

@article{arxiv.2110.13903,
  title  = {NeRV: Neural Representations for Videos},
  author = {Hao Chen and Bo He and Hanyu Wang and Yixuan Ren and Ser-Nam Lim and Abhinav Shrivastava},
  journal= {arXiv preprint arXiv:2110.13903},
  year   = {2021}
}

备注

To appear at NeurIPS 2021