中文

使用面向说话人匿名化数据的多说话人文本转语音训练

音频与语音处理 2024-05-21 v1 密码学与安全 声音

摘要

扩大语音生成模型的趋势会导致训练数据中语音身份的生物识别信息泄露风险,这引发了隐私和安全方面的顾虑。本文我们考察使用经说话人匿名化(Speaker Anonymization,SA)处理后的语音数据来训练多说话人文本转语音(Text-to-Speech,TTS)模型。我们采用了两种基于信号处理和三种基于深度神经网络的 SA 方法对 VCTK 这个多说话人 TTS 数据集进行匿名化处理,并进一步用于训练一个端到端 TTS 模型 VITS,以实现测试阶段的无声说话人 TTS。我们进行了大量客观和主观实验来评估匿名化训练数据以及使用此类数据训练的下游 TTS 模型性能。重要的是,我们发现 UTMOS(数据驱动的主观评级预测模型)和 GVD(衡量语音区别性提升的指标)是评估下游 TTS 性能的良好指标。我们希望能总结出这些见解,以帮助未来的研究人员确定 SA 系统用于多说话人 TTS 训练的优劣。

关键词

引用

@article{arxiv.2405.11767,
  title  = {Multi-speaker Text-to-speech Training with Speaker Anonymized Data},
  author = {Wen-Chin Huang and Yi-Chiao Wu and Tomoki Toda},
  journal= {arXiv preprint arXiv:2405.11767},
  year   = {2024}
}

备注

5 pages. Submitted to Signal Processing Letters. Audio sample page: https://unilight.github.io/Publication-Demos/publications/sa-tts-spl/index.html