A2TTS:面向低资源印度语言的语音合成
声音
2025-07-22 v1 人工智能
计算与语言
音频与语音处理
摘要
我们提出了A2TTS系统,旨在解决为未见说话人生成语音以及支持多种印度语言的挑战。我们的方法利用基于扩散的语音合成架构,其中说话人编码器从短音频样本中提取嵌入,以条件化DDPM解码器实现多说话人生成。为进一步增强韵律和自然性,我们采用基于参考音频的跨注意力持续时间预测机制,实现更准确且说话人一致的时序。这导致语音 closely 类似于目标说话人,同时改进了持续时间建模和整体表达。此外,为提高零样本生成效果,我们采用了无分类器引导,使系统能够更接近地为未知说话人生成语音。使用这一方法,我们训练了面向多个印度语言的语言特定说话人条件模型。这些语言包括孟加拉、古地亚、印地语、马拉拉语、泰米尔、旁遮普和泰米尔语。
引用
@article{arxiv.2507.15272,
title = {A2TTS: TTS for Low Resource Indian Languages},
author = {Ayush Singh Bhadoriya and Abhishek Nikunj Shinde and Isha Pandey and Ganesh Ramakrishnan},
journal= {arXiv preprint arXiv:2507.15272},
year = {2025}
}