ESPnet-SPK:面向说话人嵌入提取器的全流程工具包,支持可重复配方、自监督前端及即插即用模型
声音
2024-06-14 v2 人工智能
音频与语音处理
摘要
本文介绍了 ESPnet-SPK,这是一个为训练说话人嵌入提取器而设计的工具包,具备多个目标。首先,我们提供了一个开源平台,让说话人识别社区的研究者能够轻松构建模型。我们提供了多种模型,从 x-vector 到最新的 SKA-TDNN。通过模块化的架构设计,变体可以轻松开发。我们还希望将开发的模型与其他领域连接起来,促进广大研究社区能够轻松集成最新的嵌入提取器。预训练的嵌入提取器可以以即插即用的方式获取,我们通过展示其与两种任务的集成来展示该工具包的多样性。另一个目标是与多样化的自监督学习特征集成。我们发布了一个可重复配方,使用 WavLM-Large 配合 ECAPA-TDNN,在 Vox1-O 评估协议下实现了0.39% 的等错误率。
引用
@article{arxiv.2401.17230,
title = {ESPnet-SPK: full pipeline speaker embedding toolkit with reproducible recipes, self-supervised front-ends, and off-the-shelf models},
author = {Jee-weon Jung and Wangyou Zhang and Jiatong Shi and Zakaria Aldeneh and Takuya Higuchi and Barry-John Theobald and Ahmed Hussen Abdelaziz and Shinji Watanabe},
journal= {arXiv preprint arXiv:2401.17230},
year = {2024}
}
备注
5 pages, 3 figures, 7 tables, Interspeech 2024