基于分数生成模型的高保真图像压缩
图像与视频处理
2024-03-11 v3 计算机视觉与模式识别
机器学习
机器学习
摘要
尽管扩散生成模型在文本到图像生成中取得了巨大成功,但在图像压缩领域复制这一成功已被证明是困难的。在本文中,我们证明扩散可以在给定码率下显著提升感知质量,在以 FID 分数衡量时优于最先进的 PO-ELIC 和 HiFiC 方法。这是通过使用一个简单但理论动机明确的两阶段方法实现的,该方法结合了一个以 MSE 为目标的自编码器,以及一个进一步的基于分数的解码器。然而,正如我们将展示的,实现细节至关重要,且最优设计决策可能与典型的文本到图像模型大不相同。
引用
@article{arxiv.2305.18231,
title = {High-Fidelity Image Compression with Score-based Generative Models},
author = {Emiel Hoogeboom and Eirikur Agustsson and Fabian Mentzer and Luca Versari and George Toderici and Lucas Theis},
journal= {arXiv preprint arXiv:2305.18231},
year = {2024}
}