中文

零样文本到语音模型用于提升短语音说话人验证的探索

声音 2025-06-18 v1

摘要

短语音说话人验证因信息有限而面临着显著挑战,可能削弱其准确性和可靠性。最近,零样文本到语音(Zero-shot Text-to-Speech, ZS-TTS)系统在保持说话人身份方面取得了显著进展。本研究首次探索使用 ZS-TTS 系统进行说话人验证的测试时数据增强。我们在 VoxCeleb 1 数据集上评估了三种最先进的预训练 ZS-TTS 系统:NatureSpeech 3、CosyVoice 和 MaskGCT。我们的实验结果表明,结合真实语音和合成语音样本可在所有时长上实现 10%~16% 的相对平等误差率(Equal Error Rate, EER)降低,尤其在短语音上效果尤为显著,且无需对现有系统进行重新训练。然而,我们的分析揭示,较长的合成语音并未像较长的真实语音那样有效降低 EER。这一发现凸显了使用 ZS-TTS 进行测试时说话人验证的潜力与挑战,为未来研究提供了洞见。

关键词

引用

@article{arxiv.2506.14226,
  title  = {Investigation of Zero-shot Text-to-Speech Models for Enhancing Short-Utterance Speaker Verification},
  author = {Yiyang Zhao and Shuai Wang and Guangzhi Sun and Zehua Chen and Chao Zhang and Mingxing Xu and Thomas Fang Zheng},
  journal= {arXiv preprint arXiv:2506.14226},
  year   = {2025}
}