NISQA:一种用于基于众包数据集的多维语音质量预测的深度学习CNN-自注意力模型
音频与语音处理
2021-12-15 v1 人工智能
机器学习
声音
摘要
在本文中,我们提出了NISQA语音质量预测模型的更新版本,该版本聚焦于通信网络中出现的失真。与先前版本相比,该模型以端到端方式训练,并且时间依赖建模与时间池化通过自注意力机制实现。除整体语音质量外,该模型还预测噪声度、染色度、不连续性和响度这四个语音质量维度,从而更深入地揭示质量退化的原因。此外,我们创建了包含超过13,000个语音文件的新数据集用于模型的训练与验证。该模型最终在一个包含真实电话通话录音的新的实时通话测试数据集上进行了测试。总体而言,NISQA在来自不同来源的81个数据集上进行了训练与评估,并证明对未知语音样本也能提供可靠的预测。代码、模型权重与数据集均已开源。
引用
@article{arxiv.2104.09494,
title = {NISQA: A Deep CNN-Self-Attention Model for Multidimensional Speech Quality Prediction with Crowdsourced Datasets},
author = {Gabriel Mittag and Babak Naderi and Assmaa Chehadi and Sebastian Möller},
journal= {arXiv preprint arXiv:2104.09494},
year = {2021}
}
备注
Submitted to Interspeech 2021