DLF:基于双生成式潜在融合的极端图像压缩
计算机视觉与模式识别
2025-09-16 v3 图像与视频处理
摘要
近期研究在通过压缩生成式分词器的令牌来实现极端图像压缩方面取得了显著性能,但这些方法往往侧重于聚类数据集中常见的语义,同时忽略单个对象的多样细节。 Consequently,这导致在低比特率下重建保真度 suboptimal。为解决此问题,我们引入了双生成式潜在融合 (DLF) 范式。DLF 将潜在表示分解为语义元素和细节元素,通过两个不同的分支进行压缩。语义分支将高层次信息聚类为紧凑令牌,而细节分支对感知关键细节进行编码以提升整体保真度。此外,我们提出了一种跨分支交互式设计以减少两个分支之间的冗余,从而最小化总比特成本。实验结果表明,DLF 即使在每像素以下 0.01 位比特 (bpp) 也能实现令人印象深刻的重建质量。在 CLIC2020 测试集上,我们的方法在 LPIPS 上实现了最高可达 27.93% 的比特率节省,在 DISTS 上实现了 53.55% 的比特率节省。Furthermore, DLF 在视觉保真度上超过了最近的扩散基编码方法,同时保持了相当的生成式真实感。项目:https://dlfcodec.github.io/
引用
@article{arxiv.2503.01428,
title = {DLF: Extreme Image Compression with Dual-generative Latent Fusion},
author = {Naifu Xue and Zhaoyang Jia and Jiahao Li and Bin Li and Yuan Zhang and Yan Lu},
journal= {arXiv preprint arXiv:2503.01428},
year = {2025}
}
备注
Accepted by ICCV 2025