STOI-Net:一种基于深度学习的非侵入式语音可懂度评估模型
声音
2020-11-10 v1 机器学习
音频与语音处理
摘要
大多数客观语音可懂度评估指标的计算都需要以干净语音作为参考。这一要求可能限制这些指标在真实场景中的适用性。为克服该限制,我们提出了一种基于深度学习的非侵入式语音可懂度评估模型,即 STOI-Net。STOI-Net 的输入和输出分别为语音谱特征与预测的 STOI 分数。该模型由卷积神经网络与双向长短期记忆(CNN-BLSTM)架构结合乘法注意力机制构成。实验结果表明,当用含噪和增强语音语句测试时,STOI-Net 估计的 STOI 分数与实际 STOI 分数具有良好相关性。在已见测试条件(测试说话人与噪声类型包含在训练集中)和未见测试条件(测试说话人与噪声类型未包含在训练集中)下,相关系数分别为 0.97 和 0.83。结果证实了 STOI-Net 在不参考干净语音的情况下准确预测 STOI 分数的能力。
引用
@article{arxiv.2011.04292,
title = {STOI-Net: A Deep Learning based Non-Intrusive Speech Intelligibility Assessment Model},
author = {Ryandhimas E. Zezario and Szu-Wei Fu and Chiou-Shann Fuh and Yu Tsao and Hsin-Min Wang},
journal= {arXiv preprint arXiv:2011.04292},
year = {2020}
}
备注
Accepted in APSIPA 2020