中文

具有可学习位置特征的可扩展神经视频表示

计算机视觉与模式识别 2022-10-14 v1 机器学习

摘要

使用基于坐标的神经表示 (CNR) 对复杂信号进行简洁表示已取得很大进展,近期若干工作致力于将其扩展以处理视频。此处的主要挑战在于如何 (a) 缓解 CNR 训练中的计算低效,(b) 实现高质量视频编码,同时 (c) 保持参数高效。为同时满足全部要求 (a)、(b) 和 (c),我们提出具有可学习位置特征的神经视频表示 (NVP),这是一种通过引入“可学习位置特征”将视频有效摊销为潜码的的新型 CNR。具体而言,我们首先提出一种基于设计 2D 潜关键帧以沿各时空轴学习公共视频内容的 CNR 架构,其显著改善了上述三项要求。接着,我们提出利用现有强大的图像与视频编解码器作为潜码的计算/存储高效压缩过程。我们在流行的 UVG 基准上展示了 NVP 的优越性;与先前方法相比,NVP 不仅训练速度快 2 倍(少于 5 分钟),而且在使用多于 8 倍更少参数的情况下,编码质量仍从 34.07 提升至 34.57(以 PSNR 指标衡量)。我们还展示了 NVP 的有趣特性,例如视频修复、视频帧插值等。

关键词

引用

@article{arxiv.2210.06823,
  title  = {Scalable Neural Video Representations with Learnable Positional Features},
  author = {Subin Kim and Sihyun Yu and Jaeho Lee and Jinwoo Shin},
  journal= {arXiv preprint arXiv:2210.06823},
  year   = {2022}
}

备注

NeurIPS 2022. Project page with videos and code: https://subin-kim-cv.github.io/NVP/