基于语义蒸馏的单步扩散图像压缩
计算机视觉与模式识别
2025-11-27 v2 图像与视频处理
摘要
虽然最近的基于扩散的生成图像编解码器显示出令人印象深刻的性能,但其迭代采样过程引入了令人不快的延迟。本文重新审视了基于扩散的编解码器设计,认为对于生成式压缩,无需多步采样。基于这一洞察,我们提出了 OneDC(One-step Diffusion-based generative image Codec),集成了潜在压缩模块和单步扩散生成器。认识到语义引导在单步扩散中的关键作用,我们提出使用超先验作为语义信号,克服了文本提示在代表复杂视觉内容方面的局限性。为进一步增强超先验的语义能力,我们引入语义蒸馏机制,将来自预训练生成标记化器的知识传递到超先验编解码器中。此外,我们采用混合像素域和潜在域优化,以联合增强重建保真度和感知现实感。广泛的实验表明,OneDC 在单步生成下即实现了 SOTA 感知质量,比以前的多步基于扩散的编解码器实现了 39% 以上的比特率降低和 20 倍的解码速度提升。项目:https://onedc-codec.github.io/
引用
@article{arxiv.2505.16687,
title = {One-Step Diffusion-Based Image Compression with Semantic Distillation},
author = {Naifu Xue and Zhaoyang Jia and Jiahao Li and Bin Li and Yuan Zhang and Yan Lu},
journal= {arXiv preprint arXiv:2505.16687},
year = {2025}
}
备注
Accepted by NeurIPS 2025