中文

DeePAQ:基于基础模型和弱监督学习的感知音频质量指标

音频与语音处理 2025-10-15 v1

摘要

本文提出了基于深度学习的感知音频质量指标(Deep learning-based Perceptual Audio Quality metric, DeePAQ),用于评估通用音频质量。我们的方法利用度量学习(metric learning)结合音乐基础模型 MERT,依据代理标签(surrogate labels)构建捕捉一般音频失真强度的嵌入空间(embedding space)。据我们所知,DeePAQ 是通用音频质量领域首次利用弱监督标签和度量学习对音乐基础模型进行微调,同时采用低秩适配(Low-Rank Adaptation, LoRA),而其他最先进方法尚未探索这一方向。我们将提议模型与跨听觉测试中最先进的客观音频质量指标进行基准测试,涵盖音频编码和源分离领域。结果表明,我们的方法在检测编码伪影方面优于现有指标,并对未见失真(如源分离)具有良好泛化能力,凸显其鲁棒性和通用性。

关键词

引用

@article{arxiv.2510.12326,
  title  = {DeePAQ: A Perceptual Audio Quality Metric Based On Foundational Models and Weakly Supervised Learning},
  author = {Guanxin Jiang and Andreas Brendel and Pablo M. Delgado and Jürgen Herre},
  journal= {arXiv preprint arXiv:2510.12326},
  year   = {2025}
}

备注

5 pages, 2 figures