HNeRV:一种面向视频的混合神经表示
计算机视觉与模式识别
2023-04-06 v1
摘要
隐式神经表示将视频存储为神经网络,并在视频压缩和去噪等多种视觉任务中表现良好。以帧索引或位置索引为输入,隐式表示(NeRV、E-NeRV 等)从固定且与内容无关的嵌入中重建视频。此类嵌入极大限制了视频插值的回归能力和内部泛化能力。本文中,我们提出一种面向视频的混合神经表示(HNeRV),其中可学习编码器生成内容自适应嵌入,作为解码器输入。除输入嵌入外,我们引入 HNeRV 块,其确保模型参数均匀分布于整个网络,使得较高层(靠近输出的层)可具有更大容量以存储高分辨率内容和视频细节。借助内容自适应嵌入与重新设计的架构,HNeRV 在视频回归任务中的重建质量( PSNR)和收敛速度( 更快)上均优于隐式方法,并展现出更好的内部泛化。作为一种简单高效的视频表示,与传统编解码器(H.264、H.265)和基于学习的压缩方法相比,HNeRV 在速度、灵活性和部署方面也显示出解码优势。最后,我们探索了 HNeRV 在视频压缩和视频修复等下游任务上的有效性。我们在 https://haochen-rye.github.io/HNeRV 提供项目页,代码见 https://github.com/haochen-rye/HNeRV
引用
@article{arxiv.2304.02633,
title = {HNeRV: A Hybrid Neural Representation for Videos},
author = {Hao Chen and Matt Gwilliam and Ser-Nam Lim and Abhinav Shrivastava},
journal= {arXiv preprint arXiv:2304.02633},
year = {2023}
}
备注
CVPR 2023. Project page at https://haochen-rye.github.io/HNeRV, and Code at https://github.com/haochen-rye/HNeRV