中文

DINO-VITS:基于自监督说话人验证损失实现噪声鲁棒性的数据高效零样本TTS

声音 2024-06-19 v3 音频与语音处理

摘要

我们通过提出一种利用自监督DINO损失对说话人编码器进行双目标训练的方法,解决零样本TTS系统的噪声鲁棒性问题。该方法将语音合成目标引入说话人编码器,捕获更广范围的有利于语音克隆的语音特征。同时,DINO目标改善了说话人表征学习,确保对噪声的鲁棒性与说话人可区分性。实验表明,在干净与噪声条件下主观指标均有显著提升,优于传统的基于说话人编码器的TTS系统。此外,我们探索在含噪声的无标注数据上训练零样本TTS。我们采用的两阶段训练策略利用自监督语音模型区分噪声与干净语音,相比基于ASR转录的方法,在相似度与自然度上尤其在含噪声训练数据集下取得显著进展。

关键词

引用

@article{arxiv.2311.09770,
  title  = {DINO-VITS: Data-Efficient Zero-Shot TTS with Self-Supervised Speaker Verification Loss for Noise Robustness},
  author = {Vikentii Pankov and Valeria Pronina and Alexander Kuzmin and Maksim Borisov and Nikita Usoltsev and Xingshan Zeng and Alexander Golubkov and Nikolai Ermolenko and Aleksandra Shirshova and Yulia Matveeva},
  journal= {arXiv preprint arXiv:2311.09770},
  year   = {2024}
}

备注

Accepted to Interspeech2024