中文

Rasa:面向印度语言低资源环境的高表达性语音合成系统

计算与语言 2024-09-04 v2 机器学习 声音 音频与语音处理

摘要

我们发布 Rasa,首个面向印度语言的多语言高表达性语音合成数据集,其中包含每个语言 10 小时中性语音以及 1-3 小时覆盖 6 种 Ekman 情绪的表达语音,涵盖 3 种语言:阿萨姆语、孟加拉语和泰米尔语。我们的消融研究表明,仅需 1 小时中性语和 30 分钟表达语音数据即可构建出如同 MUSHRA 评分所示的公平系统。将中性数据增加到 10 小时,配合最少的表达数据,可显著提升表达性。这为资源受限语言提供了实用的配方,优先获取易获得的中性数据,同时辅以少量表达数据。我们展示了以音节为单位平衡数据和合并情绪以提升表达性的重要性。我们还指出了在生成特定情绪(如恐惧和惊讶)时面临的挑战。

关键词

引用

@article{arxiv.2407.14056,
  title  = {Rasa: Building Expressive Speech Synthesis Systems for Indian Languages in Low-resource Settings},
  author = {Praveen Srinivasa Varadhan and Ashwin Sankar and Giri Raju and Mitesh M. Khapra},
  journal= {arXiv preprint arXiv:2407.14056},
  year   = {2024}
}

备注

Accepted at INTERSPEECH 2024. First two authors listed contributed equally