中文

利用真实场景数据在说话人识别中实现有效的自监督预训练

音频与语音处理 2023-09-28 v2 声音

摘要

当前的说话人识别系统主要依赖有监督方法,受限于标注数据集的规模。为提升系统性能,研究者利用WavLM等大型预训练模型,将学习到的高层特征迁移至下游说话人识别任务。然而,该方法在推理阶段仍保留预训练模型,引入了额外参数。另一部分研究者直接将DINO等自监督方法应用于说话人嵌入学习,但尚未探索其在大规模真实场景(in-the-wild)数据集上的潜力。本文中,我们展示了在大规模WenetSpeech数据集上DINO训练的有效性,及其在提升CNCeleb数据集上有监督系统性能方面的可迁移性。此外,我们提出了一种基于置信度的数据过滤算法,以从预训练数据集中移除不可靠数据,从而以更少的训练数据取得更优性能。相关的预训练模型、置信度文件、预训练与微调脚本将在Wespeaker工具包中提供。

关键词

引用

@article{arxiv.2309.11730,
  title  = {Leveraging In-the-Wild Data for Effective Self-Supervised Pretraining in Speaker Recognition},
  author = {Shuai Wang and Qibing Bai and Qi Liu and Jianwei Yu and Zhengyang Chen and Bing Han and Yanmin Qian and Haizhou Li},
  journal= {arXiv preprint arXiv:2309.11730},
  year   = {2023}
}

备注

submitted to ICASSP 2024