中文

用于说话人识别的广义表示大规模学习

声音 2022-10-28 v2 人工智能 音频与语音处理

摘要

本工作的目标是开发一种可用于多样场景的说话人识别模型。我们假定构建此类模型需恰当配置两个组件。首先,需要恰当的架构。我们探索了若干近期state-of-the-art(SOTA)模型,包括ECAPA-TDNN与MFA-Conformer,以及其他基线。其次,需要海量数据。我们研究了结合数个现有数据集的几种新训练数据配置。最广泛的配置包含超过87k说话人的10.22k小时语音。采用四种评估协议以衡量训练模型在多样场景下的表现。通过实验,我们发现归纳偏置最小的MFA-Conformer泛化最佳。我们也表明,使用所提出的大数据配置训练可带来更优性能。观察到泛化能力提升,四种评估协议上的平均性能提升逾20%。此外,我们还证明这些模型在增大容量时性能可进一步提升。

关键词

引用

@article{arxiv.2210.10985,
  title  = {Large-scale learning of generalised representations for speaker recognition},
  author = {Jee-weon Jung and Hee-Soo Heo and Bong-Jin Lee and Jaesong Lee and Hye-jin Shim and Youngki Kwon and Joon Son Chung and Shinji Watanabe},
  journal= {arXiv preprint arXiv:2210.10985},
  year   = {2022}
}

备注

5pages, 5 tables, submitted to ICASSP