面向无明确音调标记的 Mizo 语 TTS 系统的抑韵感知
音频与语音处理
2026-01-06 v1
摘要
本文报告了开发 Mizo 语 TTS 系统的情况,该语言是一种低资源、带音调的 Tibeto-Burman 语种,主要在印度孟买拉邦的 Mizoram 州口语。尽管仅使用 5.18 小时的语料, TTS 输出在主观和客观评估中被认为是感知上可接受且易于理解的。我们构建了一个使用 Tacotron2 的基线模型,然后使用相同的语料构建了另一个 TTS 模型。在主观和客观评估中,VITS 模型优于 Tacotron2 模型。在语调合成方面,VITS 模型的语调错误率显著低于 Tacotron2 模型。该论文表明,非自回归、端到端的框架可以实现可接受的感知质量和易于理解性。
引用
@article{arxiv.2601.02073,
title = {Towards Prosodically Informed Mizo TTS without Explicit Tone Markings},
author = {Abhijit Mohanta and Remruatpuii and Priyankoo Sarmah and Rohit Sinha and Wendy Lalhminghlui},
journal= {arXiv preprint arXiv:2601.02073},
year = {2026}
}