ECAPA-TDNN 与 x-vector 说话人表征在零样本多说话人语音合成中的探索
音频与语音处理
2025-09-01 v1 声音
摘要
零样本多说话人语音合成系统依赖于说话人嵌入来合成未看到的说话人的语音,仅需短片参考语音。虽然已developed 多种用于说话人识别的说话人嵌入,但其在零零件TTS中的相对有效性仍未得到充分探索。本文采用基于 YourTTS 的TTS系统,对比评估了三种不同的说话人编码器——YourTTS 的原始 H/ASP 编码器、x-vector 嵌入和 ECAPA-TDNN 嵌入——在 otherwise 固定的零零件TTS框架内。所有模型均在相同的捷克朗读语音数据集上训练,并在24个域外目标说话人处进行主观和客观评估。主观评估通过聚焦说话人相似性的听力测试进行,而客观评估则测量从综合语音和真实语音中提取的说话人嵌入之间的余弦距离。在两方面的评估中,原始 H/ASP 编码器始终优于其他选项,ECAPA-TDNN 的表现优于 x-vector。这些发现表明,尽管 ECAPA-TDNN 在说话人识别中备受欢迎,但在本配置下的说话人相似性零零件TTS中并不一定提供改进。本研究强调在TTS中重新使用说话人识别嵌入时需要进行经验性评估,并为未来的额外比较提供了框架。
引用
@article{arxiv.2506.20190,
title = {An Exploration of ECAPA-TDNN and x-vector Speaker Representations in Zero-shot Multi-speaker TTS},
author = {Marie Kunešová and Zdeněk Hanzlíček and Jindřich Matoušek},
journal= {arXiv preprint arXiv:2506.20190},
year = {2025}
}
备注
Accepted to TSD 2025