中文

用于 MOS 预测的自监督学习模型融合

声音 2022-04-12 v1 人工智能 计算与语言 音频与语音处理

摘要

我们参加了 2022 年平均意见得分 (MOS) 预测挑战赛。该挑战旨在预测合成语音在两条赛道上的 MOS 分数:主赛道和更具挑战性的子赛道——域外 (OOD)。为提高预测分数的准确性,我们探索了若干模型融合相关策略,并提出了一种融合框架,其中引入了七个预训练的自监督学习 (SSL) 模型。这些预训练 SSL 模型源自三个 ASR 框架,包括 Wav2Vec、Hubert 和 WavLM。对于 OOD 赛道,我们沿用主赛道上选定的 7 个 SSL 模型,并采用半监督学习方法来利用无标签数据。根据官方分析结果,我们的系统在 16 项指标中的 6 项上取得第 1 名,并且在 16 项指标中的 13 项上位列前三系统。具体而言,我们在主赛道系统级别上取得了最高的 LCC、SRCC 和 KTAU 分数,以及在 OOD 赛道语句级别上的 LCC、SRCC 和 KTAU 评价指标上取得最佳表现。与基础 SSL 模型相比,融合系统的预测准确性大幅提升,尤其在 OOD 子赛道上。

关键词

引用

@article{arxiv.2204.04855,
  title  = {Fusion of Self-supervised Learned Models for MOS Prediction},
  author = {Zhengdong Yang and Wangjin Zhou and Chenhui Chu and Sheng Li and Raj Dabre and Raphael Rubino and Yi Zhao},
  journal= {arXiv preprint arXiv:2204.04855},
  year   = {2022}
}

备注

MOS 2022 shared task system description paper