压缩图像中满足用户与机器比例的预测:统一方法
计算机视觉与模式识别
2024-12-24 v1 多媒体
摘要
当今,人类寻求高质量图像以获得更佳的观看体验,而机器则需要更精确的视觉分析。然而,图像通常在消费前被压缩,导致质量下降。预测压缩图像的感知质量对于人类和机器都具有意义,这有助于指导压缩优化。本文提出了统一的方法来解决此问题。具体而言,我们创建一个基于深度学习的模型,同时预测压缩图像的满足用户比例(SUR)和满足机器比例(SMR)。我们首先在大规模标注了SMR的数据集上预训练特征提取网络,使用由多种图像质量模型生成的与人类感知相关的质量标签,模拟获取SUR标签的过程。然后,我们提出一种基于MLP-Mixer的网络,通过利用和融合提取的多层特征来预测SUR和SMR。我们引入差异特征残差学习(DFRL)模块,以学习更具辨别力的差异特征。我们进一步使用多头注意力聚合与池化(MHAAP)层来聚合差异特征并减少其冗余性。实验结果表明,所提模型显著优于现有的SUR和SMR预测方法。此外,我们的联合学习方案在人类和机器感知质量预测任务方面均有效提升了性能。
引用
@article{arxiv.2412.17477,
title = {Predicting Satisfied User and Machine Ratio for Compressed Images: A Unified Approach},
author = {Qi Zhang and Shanshe Wang and Xinfeng Zhang and Siwei Ma and Jingshan Pan and Wen Gao},
journal= {arXiv preprint arXiv:2412.17477},
year = {2024}
}