从文本到语音中学习说话人嵌入
音频与语音处理
2020-10-23 v1 机器学习
声音
摘要
零样本多说话人文本到语音(TTS)根据给定的输入文本和相应说话人嵌入生成目标说话人语音。在本工作中,我们研究 TTS 重构目标对改进说话人验证表示学习的有效性。我们以自监督方式联合训练端到端 Tacotron 2 TTS 与说话人嵌入网络。我们假设嵌入将包含极少的语音信息,因为 TTS 解码器将从文本输入中获取该信息。TTS 重构也可与说话人分类结合以进一步增强这些嵌入。一旦训练完成,说话人编码器为说话人验证任务计算表示,而其余 TTS 模块被丢弃。我们研究了基于人工或 ASR 生成转录文本训练 TTS。后者允许我们在无人工转录的数据集上训练嵌入。我们比较了 ASR 转录文本和 Kaldi 音素对齐作为 TTS 输入,表明后者因其更精细的分辨率而表现更好。无监督 TTS 嵌入相对于 i-vectors 在 LibriTTS 数据集上将等错误率(EER)绝对提升了 2.06%。带有说话人分类损失的 TTS 在 LibriTTS 和 Voxceleb1 中分别比仅使用说话人分类损失的模型将 EER 绝对提升了 0.28% 和 0.73%。
引用
@article{arxiv.2010.11221,
title = {Learning Speaker Embedding from Text-to-Speech},
author = {Jaejin Cho and Piotr Zelasko and Jesus Villalba and Shinji Watanabe and Najim Dehak},
journal= {arXiv preprint arXiv:2010.11221},
year = {2020}
}