中文

基于 2D Gaussian Splatting 的神经视频压缩

计算机视觉与模式识别 2025-05-15 v1 人工智能 机器学习 图像与视频处理

摘要

在过去几十年中,计算机视觉与图像处理研究社区一直致力于标准化视频数据通信,催生了诸如 AVC、HEVC、VVC、AV1、AV2 等标准。然而,近期的一些开创性工作致力于采用基于深度学习的技术,以在更大程度上替代传统视频编解码器流水线。神经视频编解码器(NVC)创建了一种端到端的基于机器学习的解决方案,不依赖任何手工特征(基于运动或边缘的),并且能够学习内容感知的压缩策略,相比传统方法提供了更好的适应性和更高的压缩效率。这不仅对硬件设计具有巨大潜力,而且对各种视频流媒体平台和应用也大有可为,尤其是在课堂和办公中得到广泛使用的视频会议应用(如 MS-Teams 或 Zoom)。然而,其高昂的计算需求目前限制了它们在视频会议等实时应用中的使用。为了解决这一问题,我们提出了一种基于感兴趣区域(ROI)的神经视频压缩模型,该模型利用了 2D Gaussian Splatting。与传统编解码器不同,2D Gaussian Splatting 能够进行实时解码,并且可以使用更少的数据点进行优化,仅需数千个高斯即可获得 decent 质量的输出,而 3D 场景中则需要数百万个。在本工作中,我们设计了一种视频流水线,通过将内容感知初始化策略与新颖的高斯帧间冗余降低机制相结合,将先前基于高斯泼溅的图像编解码器的编码时间缩短了 88%,从而使高斯泼溅能够用于视频编解码器解决方案,这是该神经视频编解码器领域中首创的解决方案。

关键词

引用

@article{arxiv.2505.09324,
  title  = {Neural Video Compression using 2D Gaussian Splatting},
  author = {Lakshya Gupta and Imran N. Junejo},
  journal= {arXiv preprint arXiv:2505.09324},
  year   = {2025}
}

备注

9 pages, 8 figures