中文

MSNeRV:基于多尺度特征融合的神经视频表示

计算机视觉与模式识别 2025-06-19 v1 多媒体 图像与视频处理

摘要

隐式神经表示(INR)已成为视频压缩的有前景的方法,性能与 H.266/VVC 等最先进编码器相当。然而,现有 INR 方法在表示细节丰富且快速变化的视频内容方面存在局限。这主要源于网络内部特征的 underutilization 以及缺乏针对视频的网络设计。在解决这些问题方面,我们提出了一种多尺度特征融合框架,称为 MSNeRV,用于神经视频表示。在编码阶段,我们采用时间窗口来增强时序一致性,将视频划分为多个图片组(GoP),其中使用 GoP 级网格进行背景表示。此外,我们设计了具有尺度自适应损失函数的多尺度空间解码器,以整合多分辨率和多频率信息。为进一步提高特征提取,我们引入多尺度特征模块,充分利用隐藏特征。在 HEVC ClassB 和 UVG 数据集上进行视频表示和压缩评估。实验结果表明,我们的方法在 INR 类方法中展现出卓越的表示能力,并在动态场景下相较于 VTM-23.7(随机访问)在压缩效率方面取得优势。

关键词

引用

@article{arxiv.2506.15276,
  title  = {MSNeRV: Neural Video Representation with Multi-Scale Feature Fusion},
  author = {Jun Zhu and Xinfeng Zhang and Lv Tang and JunHao Jiang},
  journal= {arXiv preprint arXiv:2506.15276},
  year   = {2025}
}