中文

SVSNet+:利用语音基础模型表示增强说话人语音相似度评估模型

音频与语音处理 2024-06-13 v1 机器学习 声音

摘要

来自预训练语音基础模型(SFM)的表示在许多下游任务中展现出了令人印象深刻的性能。然而,将预训练的SFM表示整合到说话人语音相似度评估中的潜在益处尚未得到充分研究。在本文中,我们提出了SVSNet+,一个整合了预训练SFM表示以提升说话人语音相似度评估性能的模型。在Voice Conversion Challenge 2018和2020数据集上的实验结果表明,整合了WavLM表示的SVSNet+相比基线模型有显著改进。此外,虽然使用下游任务的小数据集微调WavLM并不能提升性能,但使用相同数据集学习WavLM的加权和表示可以显著提升性能。此外,当WavLM被其他SFM替换时,SVSNet+仍然优于基线模型,并展现出强大的泛化能力。

关键词

引用

@article{arxiv.2406.08445,
  title  = {SVSNet+: Enhancing Speaker Voice Similarity Assessment Models with Representations from Speech Foundation Models},
  author = {Chun Yin and Tai-Shih Chi and Yu Tsao and Hsin-Min Wang},
  journal= {arXiv preprint arXiv:2406.08445},
  year   = {2024}
}

备注

Accepted to INTERSPEECH 2024