中文

SQuId:多种语言下的语音自然度度量

计算与语言 2023-06-02 v2 机器学习 声音 音频与语音处理

摘要

大量语音合成研究依赖于人工评测,这带来了高昂成本并拖慢了开发进程。该问题在高度多语言的应用中尤为突出,因为招募和调查评测人员可能耗时数周。我们提出了 SQuId(Speech Quality Identification,语音质量识别),一个在多语言自然度预测模型,其基于超过一百万条评分进行训练,并在 65 个语言区域进行了测试——这是迄今为止同类工作中规模最大的。核心发现是:在多个语言区域上训练单一模型始终优于单语言区域基线。我们介绍了我们的任务、该模型,并表明其相对于基于 w2v-BERT 和 VoiceMOS 的竞争性基线性能高出 50.0%。随后我们展示了微调过程中跨语言区域迁移的有效性,并强调了其在零样本语言区域(即没有微调数据的语言区域)上的作用。通过一系列分析,我们突出了非语言效应(如跨语言区域迁移中的声音伪影)的作用。最后,我们通过若干消融实验展示了我们的设计决策(例如模型规模、预训练多样性以及语言再平衡)的影响。

关键词

引用

@article{arxiv.2210.06324,
  title  = {SQuId: Measuring Speech Naturalness in Many Languages},
  author = {Thibault Sellam and Ankur Bapna and Joshua Camp and Diana Mackinnon and Ankur P. Parikh and Jason Riesa},
  journal= {arXiv preprint arXiv:2210.06324},
  year   = {2023}
}

备注

Accepted at ICASSP 2023, with additional material in the appendix