改进基于自监督学习的MOS预测网络
音频与语音处理
2022-04-26 v1 人工智能
机器学习
声音
摘要
MOS(平均意见得分)是一种用于评估系统质量的主观方法。电信(语音与视频)和语音合成系统(生成语音)是该方法的众多应用中的一部分。尽管MOS测试被广泛接受,但由于需要人工参与,它们耗时且昂贵。此外,由于测试系统和受试对象不同,结果并不真正可比。另一方面,大量既往测试使我们能够训练可预测MOS值的机器学习模型。通过自动预测MOS值,上述两个问题均可解决。本工作对先前基于自监督学习的MOS预测模型引入了数据、训练和训练后特定的改进。我们使用在LibriSpeech上预训练的wav2vec 2.0模型,并扩展以LSTM和非线性全连接层。我们引入了迁移学习、目标数据预处理、具有不同批次配置的二阶段和三阶段训练方法、丢弃累积(用于更大批次)以及预测的量化。这些方法使用首届Voice MOS挑战赛的共享合成语音数据集进行评估。
引用
@article{arxiv.2204.11030,
title = {Improving Self-Supervised Learning-based MOS Prediction Networks},
author = {Bálint Gyires-Tóth and Csaba Zainkó},
journal= {arXiv preprint arXiv:2204.11030},
year = {2022}
}
备注
Submitted to Interspeech 2022