InQSS:使用多任务学习网络的语音可懂度与质量评估模型
声音
2022-07-04 v3 机器学习
音频与语音处理
摘要
语音可懂度与质量评估模型是研究人员评估和改进语音处理模型的重要工具。然而,由于可用数据的限制,只有少数研究调查了用于可懂度和质量评估的多任务模型。在本研究中,我们发布了 TMHINT-QI,这是第一个记录纯净、含噪和增强语音的质量与可懂度得分的中文语音数据集。然后,我们提出了 InQSS,一个用于可懂度和质量评估的非侵入式多任务学习框架。我们在从零开始训练和预训练模型上均评估了 InQSS。实验结果证实了 InQSS 框架的有效性。此外,生成的模型不仅可以预测语音信号的可懂度得分,还可以预测其质量得分。
引用
@article{arxiv.2111.02585,
title = {InQSS: a speech intelligibility and quality assessment model using a multi-task learning network},
author = {Yu-Wen Chen and Yu Tsao},
journal= {arXiv preprint arXiv:2111.02585},
year = {2022}
}
备注
accepted by Insterspeech 2022