中文

E-NeRV:以解耦时空上下文加速神经视频表示

计算机视觉与模式识别 2022-07-19 v1

摘要

近来,针对视频的图像级隐式神经表示 NeRV 因其相比常规像素级隐式表示更具前景的结果与更快的速度而受到关注。然而,网络结构内冗余的参数在扩展以获得理想性能时会导致庞大的模型尺寸。造成此现象的关键原因在于 NeRV 的耦合式表述,其直接从帧索引输入输出视频帧的空域与时域信息。本文中,我们提出 E-NeRV,通过将图像级隐式神经表示分解为独立的空间与时间上下文,显著加速 NeRV。在新表述的指导下,我们的模型大幅减少了冗余模型参数,同时保留了表示能力。我们通过实验发现,我们的方法能以更少的参数在很大程度上提升性能,从而实现超过 8×8\times 的收敛速度提升。代码见 https://github.com/kyleleey/E-NeRV。

关键词

引用

@article{arxiv.2207.08132,
  title  = {E-NeRV: Expedite Neural Video Representation with Disentangled Spatial-Temporal Context},
  author = {Zizhang Li and Mengmeng Wang and Huaijin Pi and Kechun Xu and Jianbiao Mei and Yong Liu},
  journal= {arXiv preprint arXiv:2207.08132},
  year   = {2022}
}

备注

ECCV 2022