VANI:面向母语与非母语说话人且保留身份的超轻量口音可控TTS
声音
2023-03-15 v1 机器学习
音频与语音处理
摘要
我们介绍了VANI,一种超轻量多语言口音可控语音合成系统。我们的模型建立在RADMMM中提出的解耦策略之上,并支持对语音合成的口音、语言、说话人以及细粒度与能量特征进行显式控制。我们利用为ICASSP信号处理大挑战赛LIMMITS 2023发布的印度语言数据集,以3种不同语言合成语音。我们的模型支持在保留说话人声音与目标语言母语口音的同时迁移其语言。我们在竞赛的Track 使用大参数RADMMM模型,在Track 与使用轻量VANI模型。
引用
@article{arxiv.2303.07578,
title = {VANI: Very-lightweight Accent-controllable TTS for Native and Non-native speakers with Identity Preservation},
author = {Rohan Badlani and Akshit Arora and Subhankar Ghosh and Rafael Valle and Kevin J. Shih and João Felipe Santos and Boris Ginsburg and Bryan Catanzaro},
journal= {arXiv preprint arXiv:2303.07578},
year = {2023}
}
备注
Presentation accepted at ICASSP 2023