基于可学习合成参考的条件潜在编码用于深度图像压缩
计算机视觉与模式识别
2025-02-17 v1 人工智能
摘要
本文研究如何从外部词典合成动态参考,以在潜在域中执行条件编码输入图像,并以端到端方式学习条件潜在合成与编码模块。我们的方法从修改空间金字塔池化、维数缩减和多尺度特征聚类等多个阶段构建通用图像特征词典。对于每个输入图像,我们学习从词典中选择和合成相关特征以生成条件潜在,从而显著提升模型捕获和探索图像源关联的能力。该条件潜在合成涉及基于相关性的特征匹配与对齐策略,包括条件潜在匹配(CLM)模块和条件潜在合成(CLS)模块。生成的潜在向量被用于指导编码过程,实现更高效的压缩,利用输入图像与参考词典之间的关联。根据理论分析,本文提出的条件潜在编码(CLC)方法对外部词典样本和所选条件潜在的扰动具有稳健性,误差界随词典规模对数式增长,确保即使在大规模且多样化的词典下也能稳定运行。在基准数据集上进行实验表明,新方法以极小的开销(约0.5%像素比特)实现了显著编码性能提升(最高可达1.2 dB)。我们的代码已公开于https://github.com/ydchen0806/CLC。
引用
@article{arxiv.2502.09971,
title = {Conditional Latent Coding with Learnable Synthesized Reference for Deep Image Compression},
author = {Siqi Wu and Yinda Chen and Dong Liu and Zhihai He},
journal= {arXiv preprint arXiv:2502.09971},
year = {2025}
}