中文

基于深度学习的跨域特征非侵入式多目标语音评估模型

音频与语音处理 2024-12-20 v5 机器学习 声音

摘要

在本研究中,我们提出了一种称为MOSA-Net的跨域多目标语音评估模型,该模型可同时估计多个语音评估指标。实验结果表明,与现有的用于PESQ预测的单一任务模型Quality-Net相比,MOSA-Net在感知语音质量评估(PESQ)预测中可将线性相关系数(LCC)在已见噪声环境下提升0.026(0.990对比0.964),在未见噪声环境下提升0.012(0.969对比0.957);与现有的用于STOI预测的单一任务模型STOI-Net(基于CRNN)相比,在短时客观可懂度(STOI)预测中可将LCC在已见噪声环境下提升0.021(0.985对比0.964),在未见噪声环境下提升0.047(0.836对比0.789)。此外,MOSA-Net最初训练用于评估客观分数,可作为预训练模型被有效适配为以有限训练数据预测主观质量和可懂度分数的评估模型。实验结果表明,与用于MOS预测的强单一任务模型MOS-SSL相比,MOSA-Net在平均意见分数(MOS)预测中可将LCC提升0.018(0.805对比0.787)。鉴于已证实的预测能力,我们进一步采用MOSA-Net的潜在表示来引导语音增强(SE)过程,并据此推导出质量-可懂度(QI)感知的SE(QIA-SE)方法。实验结果表明,在客观评价指标和定性评估测试方面,QIA-SE相比基线SE系统提供了更优的增强性能。例如,相较于基于CNN的基线SE模型,QIA-SE在已见噪声环境下可将PESQ提升0.301(2.953对比2.652),在未见噪声环境下提升0.18(2.658对比2.478)。

关键词

引用

@article{arxiv.2111.02363,
  title  = {Deep Learning-based Non-Intrusive Multi-Objective Speech Assessment Model with Cross-Domain Features},
  author = {Ryandhimas E. Zezario and Szu-Wei Fu and Fei Chen and Chiou-Shann Fuh and Hsin-Min Wang and Yu Tsao},
  journal= {arXiv preprint arXiv:2111.02363},
  year   = {2024}
}

备注

Accepted by IEEE/ACM Transactions on Audio, Speech, and Language Processing (TASLP), vol. 31, pp. 54-70, 2023