SVSNet+:利用语音基础模型表示增强说话人语音相似度评估模型
音频与语音处理
2024-06-13 v1 机器学习
声音
摘要
来自预训练语音基础模型(SFM)的表示在许多下游任务中展现出了令人印象深刻的性能。然而,将预训练的SFM表示整合到说话人语音相似度评估中的潜在益处尚未得到充分研究。在本文中,我们提出了SVSNet+,一个整合了预训练SFM表示以提升说话人语音相似度评估性能的模型。在Voice Conversion Challenge 2018和2020数据集上的实验结果表明,整合了WavLM表示的SVSNet+相比基线模型有显著改进。此外,虽然使用下游任务的小数据集微调WavLM并不能提升性能,但使用相同数据集学习WavLM的加权和表示可以显著提升性能。此外,当WavLM被其他SFM替换时,SVSNet+仍然优于基线模型,并展现出强大的泛化能力。
引用
@article{arxiv.2406.08445,
title = {SVSNet+: Enhancing Speaker Voice Similarity Assessment Models with Representations from Speech Foundation Models},
author = {Chun Yin and Tai-Shih Chi and Yu Tsao and Hsin-Min Wang},
journal= {arXiv preprint arXiv:2406.08445},
year = {2024}
}
备注
Accepted to INTERSPEECH 2024