用于 MOS 预测系统的语音表示比较
声音
2022-06-29 v1 人工智能
音频与语音处理
摘要
为保证文本到语音系统的质量,预测听者平均意见分(MOS)的自动方法已被研究。许多先前的研究聚焦于架构上的进展(例如 MBNet、LDNet 等),以更有效的方式捕获频谱特征与 MOS 之间的关系并实现了高精度。然而,就泛化能力而言的最优表示在很大程度上仍未知。为此,我们将通过 wav2vec 框架获得的自监督学习(SSL)特征与诸如谱图幅值和梅尔谱图等频谱特征的性能进行比较。此外,我们提议将 SSL 特征与我们认为是保留自动 MOS 必要信息的特征相结合,以互补各自的缺陷。我们在从过去 Blizzard 和语音转换挑战赛收集的大规模听测语料库上进行了全面实验。我们发现,即使给定的真值并非总是可靠,wav2vec 特征集仍表现出最佳泛化能力。此外,我们发现组合特征表现最佳,并分析了它们如何弥合频谱与 wav2vec 特征集之间的差距。
引用
@article{arxiv.2206.13817,
title = {Comparison of Speech Representations for the MOS Prediction System},
author = {Aki Kunikoshi and Jaebok Kim and Wonsuk Jun and Kåre Sjölander},
journal= {arXiv preprint arXiv:2206.13817},
year = {2022}
}
备注
5 pages, 4 figures