中文

低资源场景下TTS系统语言适配的初步研究

计算与语言 2024-06-14 v1 音频与语音处理

摘要

来自大规模多语言模型的自监督学习(SSL)表示为低资源语言语音任务提供了一种有前景的解决方案。尽管取得了进展,TTS系统中的语言适配仍然是一个开放问题。本文探讨了ZMM-TTS的语言适配能力,这是我们在先前工作中提出的一个基于SSL的多语言TTS系统。我们使用有限的数据和不同的微调配置,在12种语言上进行了实验。我们证明,预训练语言和目标语言之间的语音相似性以及语言类别会影响目标语言的适配性能。此外,我们发现微调数据集大小和说话人数量会影响适配性。令人惊讶的是,我们还观察到,与仅使用音频数据相比,使用配对数据进行微调并不总是最优的。除了语音可懂度,我们的分析还涵盖了说话人相似性、语言识别和预测的MOS分数。

关键词

引用

@article{arxiv.2406.08911,
  title  = {An Initial Investigation of Language Adaptation for TTS Systems under Low-resource Scenarios},
  author = {Cheng Gong and Erica Cooper and Xin Wang and Chunyu Qiang and Mengzhe Geng and Dan Wells and Longbiao Wang and Jianwu Dang and Marc Tessier and Aidan Pine and Korin Richmond and Junichi Yamagishi},
  journal= {arXiv preprint arXiv:2406.08911},
  year   = {2024}
}

备注

Accepted to Interspeech 2024