C3:基于单张图像或视频的高性能低复杂度神经压缩
图像与视频处理
2023-12-06 v1 计算机视觉与模式识别
机器学习
机器学习
摘要
大多数神经压缩模型在大规模图像或视频数据集上训练,以泛化到未见数据。这种泛化通常需要大型且表达能力强的架构,并伴随高解码复杂度。本文提出 C3,一种具有强率失真(RD)性能的神经压缩方法,它转而针对每张图像或视频单独过拟合一个小模型。C3 的解码复杂度可比具有相似 RD 性能的神经基线方法低一个数量级。C3 基于 COOL-CHIC(Ladune 等人)构建,并对图像进行了若干简单有效的改进。我们进一步开发了新方法将 C3 应用于视频。在 CLIC2020 图像基准测试上,我们以低于 3k MACs/像素的解码复杂度,匹配了 H.266 编解码器参考实现 VTM 的 RD 性能。在 UVG 视频基准测试上,我们以低于 5k MACs/像素的解码复杂度,匹配了成熟的神经视频编解码器 Video Compression Transformer(Mentzer 等人)的 RD 性能。
引用
@article{arxiv.2312.02753,
title = {C3: High-performance and low-complexity neural compression from a single image or video},
author = {Hyunjik Kim and Matthias Bauer and Lucas Theis and Jonathan Richard Schwarz and Emilien Dupont},
journal= {arXiv preprint arXiv:2312.02753},
year = {2023}
}