中文

机器感知质量:评估严重有损压缩对音频与图像模型的影响

图像与视频处理 2024-01-17 v1 计算机视觉与模式识别 机器学习 声音 音频与语音处理

摘要

在神经数据压缩领域,主流焦点一直在于针对经典失真指标(如 PSNR 或 SSIM)或人类感知质量优化算法。随着越来越多的数据由机器而非人类消费,一种新的范式——面向机器的压缩——应运而生,该范式优先考虑保留对机器感知显著的特征,而非传统的以人为中心的准则,从而给利用有损压缩系统的开发、评估和部署带来了若干新挑战。特别是,尚不清楚不同的有损压缩方法将如何影响下游机器感知任务的性能。为解决这一尚未充分探索的领域,我们在严重有损压缩条件下评估了各种感知模型,包括图像分类、图像分割、语音识别和音乐源分离。我们利用了涵盖传统、神经和生成式压缩架构的几种流行编解码器。我们的结果表明了三个关键发现:(1) 使用生成式压缩,可以在对机器感知质量产生可忽略影响的情况下利用高度压缩的数据;(2) 机器感知质量与深度相似性指标 strongly 相关,表明这些指标在面向机器的编解码器开发中起着至关重要的作用;(3) 使用有损压缩数据集(例如 ImageNet)进行预训练可能导致反直觉的情景,其中有损压缩反而提高了机器感知质量而非使其退化。为了鼓励对这一日益增长的研究领域的参与,我们的代码和实验可在以下地址获取:https://github.com/danjacobellis/MPQ。

关键词

引用

@article{arxiv.2401.07957,
  title  = {Machine Perceptual Quality: Evaluating the Impact of Severe Lossy Compression on Audio and Image Models},
  author = {Dan Jacobellis and Daniel Cummings and Neeraja J. Yadwadkar},
  journal= {arXiv preprint arXiv:2401.07957},
  year   = {2024}
}

备注

10 pages; abridged version published in IEEE Data Compression Conference 2024