将 NVIDIA 的多说话人多语言 TTS 系统通过零样本 TTS 扩展至印度语言
声音
2024-01-30 v2 机器学习
音频与语音处理
摘要
本文描述了 NVIDIA 为 MMITS-VC(多说话人多语言印度语言 TTS 与语音克隆)2024 挑战赛开发的 TTS 模型。在赛道 1 和 2 中,我们利用 RAD-MMM,通过额外使用 5 分钟目标说话人数据进行训练来执行小样本 TTS。在赛道 3 中,我们利用 P-Flow,通过在挑战赛数据集以及外部数据集上进行训练来执行零样本 TTS。所有提交均使用 HiFi-GAN 声码器。RAD-MMM 在赛道 1 和 2 上表现具有竞争力,而 P-Flow 在赛道 3 上排名第一,平均意见得分 (MOS) 为 4.4,说话人相似度得分 (SMOS) 为 3.62。
引用
@article{arxiv.2401.13851,
title = {Scaling NVIDIA's Multi-speaker Multi-lingual TTS Systems with Zero-Shot TTS to Indic Languages},
author = {Akshit Arora and Rohan Badlani and Sungwon Kim and Rafael Valle and Bryan Catanzaro},
journal= {arXiv preprint arXiv:2401.13851},
year = {2024}
}
备注
Presentation accepted at ICASSP 2024