基于偏好的深度神经网络自动语音质量评估训练框架
音频与语音处理
2023-08-30 v1
摘要
语音质量评估(SQA)的一个目标是估计合成语音系统的排序。然而,近期的 SQA 模型通常使用低精度直接分数(如平均意见分数(MOS))作为训练目标进行训练,这对于估计排序并不直观。尽管该方法在预测单个句子的质量分数方面有效,但在对多个系统排序时未考虑语音和系统偏好。我们提出了一种 SQA 模型的训练框架,其仅可使用从 MOS 对导出的偏好分数进行训练,以改进排序预测。我们的实验揭示了我们的框架在成对生成、从语句偏好导出系统分数的聚合函数,以及从 MOS 对确定偏好的阈值函数方面表现最佳的条件。我们的结果表明,我们提出的方法在斯皮尔曼秩相关系数上显著优于基线模型。
引用
@article{arxiv.2308.15203,
title = {Preference-based training framework for automatic speech quality assessment using deep neural network},
author = {Cheng-Hung Hu and Yusuke Yasuda and Tomoki Toda},
journal= {arXiv preprint arXiv:2308.15203},
year = {2023}
}
备注
Accepted by Interspeech 2023, oral