SAMOS:一种利用语义表示和声学特征的神经MOS预测模型
声音
2024-11-19 v1 音频与语音处理
摘要
使用平均意见分(MOS)预测模型评估语音自然度,对语音合成系统的自动评估具有积极意义。早期的MOS预测模型以语音的原始波形或幅度谱作为输入,而更先进的方法则采用基于自监督学习(SSL)的模型从语音中提取语义表示用于MOS预测。这些方法仅利用了语音信息的有限方面进行MOS预测,导致预测精度受限。因此,本文提出SAMOS,一种同时利用待评估语音的语义和声学信息的MOS预测模型。具体而言,所提出的SAMOS利用预训练的wav2vec2提取语义表示,并使用预训练的BiVocoder的特征提取器提取声学特征。然后将这两类特征输入到包含多任务头和聚合层的预测网络中,以获得最终的MOS分数。实验结果表明,根据系统级评估指标的结果,所提出的SAMOS在BVCC数据集上优于当前最先进的MOS预测模型,并在BC2019数据集上取得了相当的性能。
引用
@article{arxiv.2411.11232,
title = {SAMOS: A Neural MOS Prediction Model Leveraging Semantic Representations and Acoustic Features},
author = {Yu-Fei Shi and Yang Ai and Ye-Xin Lu and Hui-Peng Du and Zhen-Hua Ling},
journal= {arXiv preprint arXiv:2411.11232},
year = {2024}
}