中文

将 NVIDIA 的多说话人多语言 TTS 系统通过零样本 TTS 扩展至印度语言

声音 2024-01-30 v2 机器学习 音频与语音处理

摘要

本文描述了 NVIDIA 为 MMITS-VC(多说话人多语言印度语言 TTS 与语音克隆)2024 挑战赛开发的 TTS 模型。在赛道 1 和 2 中,我们利用 RAD-MMM,通过额外使用 5 分钟目标说话人数据进行训练来执行小样本 TTS。在赛道 3 中,我们利用 P-Flow,通过在挑战赛数据集以及外部数据集上进行训练来执行零样本 TTS。所有提交均使用 HiFi-GAN 声码器。RAD-MMM 在赛道 1 和 2 上表现具有竞争力,而 P-Flow 在赛道 3 上排名第一,平均意见得分 (MOS) 为 4.4,说话人相似度得分 (SMOS) 为 3.62。

关键词

引用

@article{arxiv.2401.13851,
  title  = {Scaling NVIDIA's Multi-speaker Multi-lingual TTS Systems with Zero-Shot TTS to Indic Languages},
  author = {Akshit Arora and Rohan Badlani and Sungwon Kim and Rafael Valle and Bryan Catanzaro},
  journal= {arXiv preprint arXiv:2401.13851},
  year   = {2024}
}

备注

Presentation accepted at ICASSP 2024