具有文本质量增强的学习型图像压缩
计算机视觉与模式识别
2024-02-14 v1 机器学习
摘要
学习型图像压缩因其在实现超低比特率方面的效率而广受欢迎。然而,包含大量文本内容的图像,特别是屏幕内容图像 (SCI),在此类压缩水平下往往遭受文本失真。为解决这一问题,我们提出最小化一种新颖的文本 logit 损失,旨在量化原始图像与重建图像之间文本的差异,从而提高重建文本的感知质量。通过在多样化数据集上进行严格实验并采用最先进 (SOTA) 算法,我们的研究结果表明,将所提出的损失函数与适当的权重相结合,可显著增强重建文本的质量。值得注意的是,通过对两个截图数据集应用文本 logit 损失,我们在字符错误率 (CER) 上平均实现了 -32.64% 的 Bjontegaard delta (BD) 速率,在词错误率 (WER) 上平均实现了 -28.03% 的 BD 速率。此外,我们提出了专门用于评估图像压缩任务中文本质量的定量指标。我们的发现强调了所提出的文本 logit 损失函数在各种文本感知图像压缩上下文中的有效性和潜在适用性。
引用
@article{arxiv.2402.08643,
title = {Learned Image Compression with Text Quality Enhancement},
author = {Chih-Yu Lai and Dung Tran and Kazuhito Koishida},
journal= {arXiv preprint arXiv:2402.08643},
year = {2024}
}
备注
Submitted to ICIP 2024