中文

基于 FastPitch 的自然语音合成与说话人适应的高效训练策略

音频与语音处理 2024-10-10 v1

摘要

本文聚焦于 FastPitch 模型功能在罗马尼亚语方面的适配;将说话人数量从 1 人扩展至 18 人;实现基于匿名身份的语音合成;以及复制新出现的、未见过的说话人的身份。本工作期间,我们测试并讨论了 various 配置和训练策略的影响及其优势与局限。最终,我们确定了一种新的配置,该配置基于 FastPitch 架构,能够为已知(来自训练数据集中身份)和未知(通过短参考样本学习的身份)说话人产生自然的语音合成。匿名说话人可用于文本转语音合成,以在保持语义内容完整清晰的同时消除身份信息。最后,我们讨论了本工作的可能局限,这将为未来的研究与进步奠定基础。

关键词

引用

@article{arxiv.2410.06787,
  title  = {Efficient training strategies for natural sounding speech synthesis and speaker adaptation based on FastPitch},
  author = {Teodora Răgman and Adriana Stan},
  journal= {arXiv preprint arXiv:2410.06787},
  year   = {2024}
}

备注

Accepted at 2024 IEEE 20th International Conference on Intelligent Computer Communication and Processing (ICCP 2024)