PNeRV:通过金字塔神经表示增强视频空间一致性
计算机视觉与模式识别
2024-04-16 v1
摘要
视频神经表示 (NeRV) 的主要目标是有效建模其时空一致性。然而,当前的 NeRV 模型常常面临空间不一致的严重问题,导致感知质量下降。为解决此问题,我们引入了金字塔神经视频表示 (PNeRV),它基于多尺度信息连接构建,包含轻量级重缩放算子、Kronecker 全连接层 (KFc) 和良性选择性记忆 (BSM) 机制。KFc 受普通全连接层的张量分解启发,能够实现低成本的重缩放和全局相关性建模。BSM 机制自适应地融合高层特征与细粒度特征。此外,我们基于 NeRV 的通用逼近理论提供了分析,并验证了所提出的 PNeRV 的有效性。我们进行了全面实验,证明 PNeRV 在 UVG 和 DAVIS 数据集上的多种指标(PSNR、SSIM、LPIPS 和 FVD)均优于现有 NeRV 模型,达到了最佳的视频回归性能。与标准 NeRV 相比,PNeRV 在 UVG 上 PSNR 提升了 +4.49 dB,FVD 提升了 231%;在 DAVIS 上 PSNR 提升了 +3.28 dB,FVD 提升了 634%。
引用
@article{arxiv.2404.08921,
title = {PNeRV: Enhancing Spatial Consistency via Pyramidal Neural Representation for Videos},
author = {Qi Zhao and M. Salman Asif and Zhan Ma},
journal= {arXiv preprint arXiv:2404.08921},
year = {2024}
}