中文

SNeRV:保频视频神经表示

图像与视频处理 2025-01-06 v1 计算机视觉与模式识别

摘要

视频神经表示 (NeRV) 采用神经网络对视频信号进行参数化,引入了一种视频表示的新方法。然而,由于谱偏置(即神经网络学习高频 (HF) 分量的速度慢于低频 (LF) 分量),现有的基于 NeRV 的方法难以捕捉精细的空间细节和运动模式。在本文中,我们提出了保频 NeRV (SNeRV) 作为一种通过高效处理各种频率分量来增强隐式视频表示的新方法。SNeRV 使用 2D 离散小波变换 (DWT) 将视频分解为 LF 和 HF 特征,保留空间结构并直接解决谱偏置问题。为了平衡紧凑性,我们仅编码 LF 分量,而包含精细纹理的 HF 分量由解码器生成。包括多分辨率融合单元 (MFU) 和高频恢复器 (HFR) 在内的专用模块被集成到主干网络中以促进表示。此外,我们将 SNeRV 扩展为通过将这种扩展视为对时间域的额外频率分解,来有效捕捉相邻视频帧之间的时间相关性。这种方法使我们能够使用时间扩展上采样块 将时空 LF 特征嵌入到网络中。实验结果表明,SNeRV 在捕捉精细细节方面优于现有的 NeRV 模型,并实现了增强的重建效果,使其成为隐式视频表示领域中一种有前景的方法。代码可在 https://github.com/qwertja/SNeRV 获取。

关键词

引用

@article{arxiv.2501.01681,
  title  = {SNeRV: Spectra-preserving Neural Representation for Video},
  author = {Jina Kim and Jihoo Lee and Je-Won Kang},
  journal= {arXiv preprint arXiv:2501.01681},
  year   = {2025}
}

备注

ECCV 2024