HiNeRV:基于分层编码神经表示的视频压缩
图像与视频处理
2024-06-11 v3 计算机视觉与模式识别
摘要
基于学习的视频压缩是当前热门研究方向,具有与传统标准视频编解码器竞争的潜力。在此背景下,隐式神经表示 (INRs) 先前已被用于表征和压缩图像与视频内容,相较于其他方法展现出较高的解码速度。然而,现有基于 INR 的方法未能提供可与视频压缩最优方法媲美的率失真性能。这主要归因于所采用网络架构的简单性限制了其表征能力。本文提出 HiNeRV,一种将轻量层与新颖的分层位置编码相结合的 INR。我们采用深度可分离卷积、MLP 与插值层构建具有高容量的深层宽网络架构。HiNeRV 也是一种统一表示,同时以帧和块编码视频,相较现有方法具有更高性能与灵活性。我们进一步基于 HiNeRV 构建了视频编解码器,以及用于在保真模型压缩中更好保持 HiNeRV 性能的训练、剪枝与量化精炼流程。所提方法在 UVG 与 MCL-JCV 数据集上进行了视频压缩评估,相较所有现有 INR 基线有显著提升,且与基于学习的编解码器相比具有竞争力(在 UVG 数据集上以 PSNR 衡量,相较 HNeRV 总体码率节省 72.3%,相较 DCVC 节省 43.4%)。
引用
@article{arxiv.2306.09818,
title = {HiNeRV: Video Compression with Hierarchical Encoding-based Neural Representation},
author = {Ho Man Kwan and Ge Gao and Fan Zhang and Andrew Gower and David Bull},
journal= {arXiv preprint arXiv:2306.09818},
year = {2024}
}