中文

DS-NeRV:基于分解静态和动态编码的隐式神经视频表示

计算机视觉与模式识别 2024-03-26 v1 多媒体

摘要

隐式神经视频表示最近成为高质量视频表示的一种新方法。然而,现有工作使用单一网络表示整个视频,这隐式地混淆了静态和动态信息,导致无法有效压缩冗余的静态信息,并且缺乏对全局时间连贯动态细节的显式建模。为解决上述问题,我们提出了DS-NeRV,它将视频分解为稀疏的可学习静态编码和动态编码,无需显式的光流或残差监督。通过对两种编码设置不同的采样率,并应用加权求和与插值采样方法,DS-NeRV在保持高频细节的同时有效利用了冗余的静态信息。此外,我们设计了一个基于跨通道注意力的融合模块,以高效融合这两种编码进行帧解码。由于分离的静态和动态编码表示,我们的方法仅用0.35M参数即可实现31.2 PSNR的高质量重建,并在许多下游任务中优于现有NeRV方法。我们的项目网站位于https://haoyan14.github.io/DS-NeRV。

关键词

引用

@article{arxiv.2403.15679,
  title  = {DS-NeRV: Implicit Neural Video Representation with Decomposed Static and Dynamic Codes},
  author = {Hao Yan and Zhihui Ke and Xiaobo Zhou and Tie Qiu and Xidong Shi and Dadong Jiang},
  journal= {arXiv preprint arXiv:2403.15679},
  year   = {2024}
}

备注

CVPR 2024. Project page at https://haoyan14.github.io/DS-NeRV