说话人建模概述:从深层说话人表征学习的视角
音频与语音处理
2024-11-05 v2 声音
摘要
说话人个性信息是语音信号中最关键的元素之一。通过对该信息进行彻底且准确的建模,可以在各种智能语音应用中加以利用,例如说话人识别、说话人分割、语音合成和目标说话人提取。本综述从理论和实践两个视角全面回顾了神经网络方法的说话人表征学习。理论上,我们讨论了从监督学习到自监督学习的说话人编码器,从单一模型到大规模预训练模型,从纯粹的说话人嵌入学习到与下游任务联合优化,以及向可解释性努力。实践上,我们系统性地检查了鲁棒性和有效性的方法,介绍并比较了该领域各种开源工具包。通过对相关文献、研究活动和资源的系统性全面回顾,我们为说话人特征化和建模领域的研究人员提供了清晰的参考,也为希望将说话人建模技术应用于特定下游任务的开发者提供了指导。
引用
@article{arxiv.2407.15188,
title = {Overview of Speaker Modeling and Its Applications: From the Lens of Deep Speaker Representation Learning},
author = {Shuai Wang and Zhengyang Chen and Kong Aik Lee and Yanmin Qian and Haizhou Li},
journal= {arXiv preprint arXiv:2407.15188},
year = {2024}
}
备注
Accepted to TASLP