中文

C3:基于单张图像或视频的高性能低复杂度神经压缩

图像与视频处理 2023-12-06 v1 计算机视觉与模式识别 机器学习 机器学习

摘要

大多数神经压缩模型在大规模图像或视频数据集上训练,以泛化到未见数据。这种泛化通常需要大型且表达能力强的架构,并伴随高解码复杂度。本文提出 C3,一种具有强率失真(RD)性能的神经压缩方法,它转而针对每张图像或视频单独过拟合一个小模型。C3 的解码复杂度可比具有相似 RD 性能的神经基线方法低一个数量级。C3 基于 COOL-CHIC(Ladune 等人)构建,并对图像进行了若干简单有效的改进。我们进一步开发了新方法将 C3 应用于视频。在 CLIC2020 图像基准测试上,我们以低于 3k MACs/像素的解码复杂度,匹配了 H.266 编解码器参考实现 VTM 的 RD 性能。在 UVG 视频基准测试上,我们以低于 5k MACs/像素的解码复杂度,匹配了成熟的神经视频编解码器 Video Compression Transformer(Mentzer 等人)的 RD 性能。

关键词

引用

@article{arxiv.2312.02753,
  title  = {C3: High-performance and low-complexity neural compression from a single image or video},
  author = {Hyunjik Kim and Matthias Bauer and Lucas Theis and Jonathan Richard Schwarz and Emilien Dupont},
  journal= {arXiv preprint arXiv:2312.02753},
  year   = {2023}
}