中文

语音MOS多任务学习与评分者偏差校正

声音 2022-12-06 v1 人工智能 音频与语音处理

摘要

感知语音质量是电话会议应用的一项重要性能指标。平均意见得分(MOS)是语音质量感知评估的标准方法,通过让听者对所听语音样本的质量进行评分获得。近来,开发盲估计MOS模型的研究兴趣日益增长。本文提出一种多任务框架,在训练中引入额外标签与数据,以提升盲MOS估计模型的性能。实验结果表明,所提模型可通过合并两个不相交的训练数据集(一个仅含MOS标签,另一个仅含混响时间T60与清晰度C50标签)联合估计MOS、T60与C50。此外,我们采用半监督框架合并两个MOS数据集进行训练:一个仅含MOS标签(依据ITU-T建议书P.808),另一个含语音信号、背景噪声与整体质量的独立评分(依据ITU-T建议书P.835)。最后,我们给出了处理MOS标签中个体评分者偏差的初步结果。

关键词

引用

@article{arxiv.2212.01911,
  title  = {Speech MOS multi-task learning and rater bias correction},
  author = {Haleh Akrami and Hannes Gamper},
  journal= {arXiv preprint arXiv:2212.01911},
  year   = {2022}
}

备注

Submitted to ICASSP 2023