中文

高频增强混合神经表示用于视频压缩

计算机视觉与模式识别 2025-05-01 v2 人工智能 图像与视频处理

摘要

视频神经表示(NeRV)通过将视频内容编码为神经网络,简化了视频编解码过程并实现了快速解码速度,为视频压缩提供了一种有前景的解决方案。然而,现有工作忽视了一个关键问题,即这些方法重建的视频缺乏高频细节。为了解决这一问题,本文提出了一种高频增强混合神经表示网络。我们的方法侧重于利用高频信息来改善网络对细粒度细节的合成。具体而言,我们设计了一种小波高频编码器,该编码器包含小波频率分解器(WFD)模块,用于生成高频特征嵌入。接下来,我们设计了高频特征调制(HFM)模块,该模块利用提取的高频嵌入来增强解码器的拟合过程。最后,通过改进的谐波解码器模块和动态加权频率损失,我们进一步减少了高频信息的潜在损失。在Bunny和UVG数据集上的实验表明,我们的方法优于其他方法,在细节保持和压缩性能方面均有显著提升。

关键词

引用

@article{arxiv.2411.06685,
  title  = {High-Frequency Enhanced Hybrid Neural Representation for Video Compression},
  author = {Li Yu and Zhihui Li and Jimin Xiao and Moncef Gabbouj},
  journal= {arXiv preprint arXiv:2411.06685},
  year   = {2025}
}