MTI-Net:一种多目标语音可懂度预测模型
音频与语音处理
2022-09-01 v2 机器学习
声音
摘要
近年来,基于深度学习(DL)的非侵入式语音评估模型引起了广泛关注。许多研究报道这些基于DL的模型取得了令人满意的评估性能和良好的灵活性,但其在未知环境中的性能仍是一个挑战。此外,与质量分数相比,阐述深度学习模型以估计可懂度分数的研究较少。本研究提出一种称为MTI-Net的多任务语音可懂度预测模型,用于同时预测人类和机器的可懂度度量。具体而言,给定一段语音,MTI-Net被设计用于预测人类主观听音测试结果和词错误率(WER)分数。我们还研究了若干可提升MTI-Net预测性能的方法。首先,我们比较了MTI-Net的不同特征(包括低层特征和来自自监督学习(SSL)模型的嵌入)与预测目标。其次,我们探索了迁移学习和多任务学习在训练MTI-Net上的效果。最后,我们考察了微调SSL嵌入的潜在优势。实验结果证明了使用跨域特征、多任务学习和微调SSL嵌入的有效性。此外,确认MTI-Net预测的可懂度分数和WER分数与真实分数高度相关。
引用
@article{arxiv.2204.03310,
title = {MTI-Net: A Multi-Target Speech Intelligibility Prediction Model},
author = {Ryandhimas E. Zezario and Szu-wei Fu and Fei Chen and Chiou-Shann Fuh and Hsin-Min Wang and Yu Tsao},
journal= {arXiv preprint arXiv:2204.03310},
year = {2022}
}
备注
Accepted to Interspeech 2022