中文

NIRVANA:基于自适应网络与自回归块级建模的视频神经隐式表示

计算机视觉与模式识别 2023-01-02 v1

摘要

隐式神经表示(INR)近来已被证明是高质量视频压缩的有力工具。然而,现有工作存在局限,因其未显式利用视频中的时间冗余,导致编码时间长。此外,这些方法具有固定架构,无法扩展到更长视频或更高分辨率。为解决这些问题,我们提出NIRVANA,其将视频视为帧组并为每组拟合独立网络以执行块级预测。该设计在每组内于空间和时间维度共享计算,从而减少了视频的编码时间。视频表示以自回归方式建模,当前组上拟合的网络使用来自前一组模型的权重进行初始化。为进一步提升效率,我们在训练期间对网络参数进行量化,无需事后剪枝或量化。在与基准UVG数据集上的先前工作比较时,NIRVANA将编码质量从37.36提升至37.70(以PSNR计),并将编码速度提升12倍,同时保持相同的压缩率。与先前难以处理更大分辨率和更长视频的视频INR工作不同,我们展示了我们的算法具有高度灵活性,并因其块级和自回归设计而自然扩展。此外,我们的方法通过适应具有不同帧间运动的视频实现了可变码率压缩。NIRVANA实现了6倍解码速度,并随更多GPU良好扩展,使其适用于各种部署场景。

关键词

引用

@article{arxiv.2212.14593,
  title  = {NIRVANA: Neural Implicit Representations of Videos with Adaptive Networks and Autoregressive Patch-wise Modeling},
  author = {Shishira R Maiya and Sharath Girish and Max Ehrlich and Hanyu Wang and Kwot Sin Lee and Patrick Poirson and Pengxiang Wu and Chen Wang and Abhinav Shrivastava},
  journal= {arXiv preprint arXiv:2212.14593},
  year   = {2023}
}