中文

基于显著性对比预训练的 JSQA 语音质量评估

音频与语音处理 2025-07-17 v1 人工智能 机器学习

摘要

语音质量评估 (SQA) 常用于从高维输入空间学习一个映射,将其映射到表示感知语音质量的平均意见分数 (MOS) 的标量。由于 MOS 存在较高的内在方差(源于感知和实验设计差异),学习这种映射具有诸多挑战。虽然提出了许多解决方案,但许多方法未能在学习算法中(仅限于 MOS 标签之外)正确地融入感知因素,这可能导致效果不佳。为此,我们提出了 JSQA 框架,该框架采用基于显著性对比学习的感知导向预训练,针对显著性差异 (JND) 音频对进行预训练,然后进行 MOS 预测微调。我们首先生成处于 JND 水平的音频数据对,然后用于预训练编码器以利用感知质量相似性信息并将其映射到嵌入空间。JND 对来自干净 LibriSpeech 语料的说话人录音,混合来自 CHiME-3 的背景噪声,信号信噪比 (SNR) 不同。随后,编码器使用来自 NISQA 数据集的音频样本进行 MOS 预测微调。实验结果表明,与从头训练且无预训练的相同网络相比,感知导向的对比预训练在各种指标下显著提高了模型性能。这些发现表明,将感知因素纳入预训练过程对 SQA 的性能提升具有重要贡献。

关键词

引用

@article{arxiv.2507.11636,
  title  = {JSQA: Speech Quality Assessment with Perceptually-Inspired Contrastive Pretraining Based on JND Audio Pairs},
  author = {Junyi Fan and Donald Williamson},
  journal= {arXiv preprint arXiv:2507.11636},
  year   = {2025}
}

备注

Accepted to WASPAA 2025