中文

基于自动韵律标注的低资源蒙古语语音合成

声音 2023-01-05 v2 音频与语音处理

摘要

尽管基于深度学习的文本到语音(TTS)模型如 VITS 已展现出优异结果,它们通常需要大量高质量<文本, 音频>对进行训练,而收集成本高昂。迄今为止,世界上大多数语言仍缺乏开发 TTS 系统所需的训练数据。本文针对低资源蒙古语语音合成面临的两个问题提出两种改进方法:a) 鉴于缺乏高质量<文本, 音频>对数据,难以建模从语言特征到声学特征的映射问题,采用预训练 VITS 模型与迁移学习方法进行改进。b) 针对标注信息少的问题,本文提出使用自动韵律标注方法对文本与对应语音的韵律信息进行标注,从而提升低资源蒙古语的自然度与可懂度。通过实证研究,本文所提方法的 N-MOS 为 4.195,I-MOS 为 4.228。

关键词

引用

@article{arxiv.2211.09365,
  title  = {Low-Resource Mongolian Speech Synthesis Based on Automatic Prosody Annotation},
  author = {Xin Yuan and Robin Feng and Mingming Ye},
  journal= {arXiv preprint arXiv:2211.09365},
  year   = {2023}
}

备注

Accepted by NCMMSC 2022