可扩展的可控口音文语转换
音频与语音处理
2025-08-12 v1
摘要
我们致力于解决口音文语转换(TTS)系统扩展的挑战,将其能力扩展到包含更大规模的训练数据和更多样的口音标签,甚至包括那些在传统TTS数据集中代表性不足或未标注的口音。为此,我们采用两种策略:1. 通过语音地理定位模型发现口音标签,该模型能自动从原始语音数据中推断口音标签,而不完全依赖人工标注;2. 通过kNN语音转换进行音色增强,以增加数据多样性和模型鲁棒性。这些策略在CommonVoice数据集上得到验证,我们在此数据集上微调XTTS-v2,使用地理定位发现或增强的口音标签进行口音TTS。我们证明,由此产生的口音TTS模型不仅优于在CommonVoice自报口音标签上微调的XTTS-v2,也优于现有的口音TTS基准。
引用
@article{arxiv.2508.07426,
title = {Scalable Controllable Accented TTS},
author = {Henry Li Xinyuan and Zexin Cai and Ashi Garg and Kevin Duh and Leibny Paola García-Perera and Sanjeev Khudanpur and Nicholas Andrews and Matthew Wiesner},
journal= {arXiv preprint arXiv:2508.07426},
year = {2025}
}
备注
Accepted at IEEE ASRU 2025