中文

UTMOS:东京大学-SaruLab 用于 VoiceMOS Challenge 2022 的系统

声音 2022-06-30 v2 音频与语音处理

摘要

我们提出了提交至 VoiceMOS Challenge 2022 的东京大学-SaruLab 平均意见得分(MOS)预测系统。该挑战旨在预测先前 Blizzard Challenges 与 Voice Conversion Challenges 中收集的语音样本的 MOS 值,包含两个赛道:用于域内预测的主赛道,以及标注数据较少、来自不同听测的域外(OOD)赛道。我们的系统基于强学习器与弱学习器的集成学习。强学习器对先前的自监督学习(SSL)模型微调方法进行了若干改进,而弱学习器使用基础机器学习方法从 SSL 特征预测分数。在挑战中,我们的系统在主赛道与 OOD 赛道的多项指标上均取得最高分。此外,我们进行了消融实验以探究所提方法的有效性。

关键词

引用

@article{arxiv.2204.02152,
  title  = {UTMOS: UTokyo-SaruLab System for VoiceMOS Challenge 2022},
  author = {Takaaki Saeki and Detai Xin and Wataru Nakata and Tomoki Koriyama and Shinnosuke Takamichi and Hiroshi Saruwatari},
  journal= {arXiv preprint arXiv:2204.02152},
  year   = {2022}
}

备注

Accepted to INTERSPEECH 2022