中文

基于潜在条件残差去噪扩散模型的高保真感知图像和视频压缩

图像与视频处理 2025-05-20 v1 计算机视觉与模式识别

摘要

去噪扩散模型在多个图像生成任务中取得了令人瞩目的成绩,常常超过基于生成对抗网络 (GAN) 的模型。最近,扩散模型的生成能力被用于感知图像压缩,例如在 CDC 模型中。这些扩散方法的一个主要缺点是:虽然在感知质量方面表现出色,但与其他旨在保真度的传统或学习图像压缩方案相比,分辨率/失真度较低。在本文中,我们提出了一种针对感知质量优化的混合压缩方案,延续了 CDC 模型的方法,通过引入解码器网络来降低对 PSNR 等失真度量指标的影响。经过解码器网络生成初始图像(针对失真进行优化),潜在条件扩散模型通过预测残差来细化重建,以实现感知质量。在标准基准测试中,我们在感知分数(LPIPS 和 FID)相当的情况下实现了最高可达 +2dB 的 PSNR 保真度提升。此外,该方法容易扩展到视频压缩,在视频压缩中我们取得了类似的结果。

关键词

引用

@article{arxiv.2505.13152,
  title  = {Higher fidelity perceptual image and video compression with a latent conditioned residual denoising diffusion model},
  author = {Jonas Brenig and Radu Timofte},
  journal= {arXiv preprint arXiv:2505.13152},
  year   = {2025}
}

备注

Accepted at AIM Workshop 2024 at ECCV 2024