MNeRV:面向视频的多层神经表示
计算机视觉与模式识别
2024-07-11 v1 图像与视频处理
摘要
作为一种新的视频表示方法,Neural Representations for Videos (NeRV) 在视频压缩、视频修复和视频插值等领域展现出巨大的潜力。在使用NeRV表示视频时,每一帧对应一个嵌入向量,该嵌入向量经过少数解码层(如E-NeRV、HNeRV等)后重建为视频帧序列。然而,这少数的解码层容易导致模型参数冗余,因为单个解码层的参数占比很大,这大大限制了神经网络模型的视频回归能力。本文提出一种面向视频的多层神经表示(MNeRV),并设计了新的解码器M-Decoder及其匹配编码器M-Encoder。MNeRV拥有更多的编码和解码层,有效缓解了因层数不足导致的模型参数冗余问题。在视频回归重建领域,我们以更少的参数实现了更好的重建质量(+4.06 PSNR)。最后,我们展示了MNeRV在下游任务如视频修复和视频插播中的性能。MNeRV的源代码可在https://github.com/Aaronbtb/MNeRV 获取。
引用
@article{arxiv.2407.07347,
title = {MNeRV: A Multilayer Neural Representation for Videos},
author = {Qingling Chang and Haohui Yu and Shuxuan Fu and Zhiqiang Zeng and Chuangquan Chen},
journal= {arXiv preprint arXiv:2407.07347},
year = {2024}
}
备注
14 pages, 12 figures, 8 table