基于空间时间引导的MetaNeRV:元神经表示用于视频
计算机视觉与模式识别
2025-01-20 v2
摘要
视频神经表示(NeRV)作为一种有前景的隐式神经表示(INR)方法,代表将视频表示为以帧索引为输入的神经网络。然而,NeRV方法在适应大量多样化视频时耗时,因为每个视频都需要从头训练一个独立的NeRV模型。此外,NeRV方法在空间维度上需要从低维时间戳输入生成高维信号(即整个图像),而视频通常由数十帧组成,相邻帧之间差异较小。为提高视频表示的效率,我们提出了用于视频的元神经表示,称为MetaNeRV,是一个针对未见视频的快速NeRV表示框架。MetaNeRV利用元学习框架学习最优参数初始化,以作为适应新视频的良好起点。为解决视频模态的独特空间和时间特征,我们进一步引入空间时间引导以提高MetaNeRV的表示能力。具体而言,空间引导采用多分辨率损失以捕获不同分辨率阶段的信息,时间引导通过有效的渐进学习策略可逐步细化元学习过程中拟合的帧数。在多个数据集上进行的广泛实验表明,MetaNeRV在视频表示和视频压缩方面具有优势。
引用
@article{arxiv.2501.02427,
title = {MetaNeRV: Meta Neural Representations for Videos with Spatial-Temporal Guidance},
author = {Jialong Guo and Ke liu and Jiangchao Yao and Zhihua Wang and Jiajun Bu and Haishuai Wang},
journal= {arXiv preprint arXiv:2501.02427},
year = {2025}
}
备注
Accepted by AAAI2025