中文

基于分数生成模型的高保真图像压缩

图像与视频处理 2024-03-11 v3 计算机视觉与模式识别 机器学习 机器学习

摘要

尽管扩散生成模型在文本到图像生成中取得了巨大成功,但在图像压缩领域复制这一成功已被证明是困难的。在本文中,我们证明扩散可以在给定码率下显著提升感知质量,在以 FID 分数衡量时优于最先进的 PO-ELIC 和 HiFiC 方法。这是通过使用一个简单但理论动机明确的两阶段方法实现的,该方法结合了一个以 MSE 为目标的自编码器,以及一个进一步的基于分数的解码器。然而,正如我们将展示的,实现细节至关重要,且最优设计决策可能与典型的文本到图像模型大不相同。

关键词

引用

@article{arxiv.2305.18231,
  title  = {High-Fidelity Image Compression with Score-based Generative Models},
  author = {Emiel Hoogeboom and Eirikur Agustsson and Fabian Mentzer and Luca Versari and George Toderici and Lucas Theis},
  journal= {arXiv preprint arXiv:2305.18231},
  year   = {2024}
}