Speech2Phone:一种训练说话人识别模型的新颖高效方法
计算与语言
2021-06-22 v2 声音
音频与语音处理
摘要
本文提出一种利用小规模或资源不足数据集训练说话人识别模型的高效方法。该方法所需数据少于其他SOTA(State-Of-The-Art,最先进)方法,例如Angular Prototypical与GE2E损失函数,同时取得与这些方法相近的结果。这是利用说话人语音中音素重构的知识实现的。为此构建了一个新数据集,由40名男性说话人组成,他们朗读葡萄牙语句子,总计约3小时。我们比较了用本方法训练的三种最佳架构以选出最优者,即具有浅层架构的模型。随后,我们将该模型与说话人识别任务的SOTA方法进行比较:使用约2000小时数据训练的Fast ResNet-34,采用Angular Prototypical与GE2E损失函数。使用不同语言的数据集进行了三组实验。在这三组中,我们的模型在两组实验中取得第二佳结果,在其中一个取得最佳结果。这凸显了我们方法的重要性,其以少500倍的数据和更简单的方案,证明是SOTA说话人识别模型的强劲竞争者。
引用
@article{arxiv.2002.11213,
title = {Speech2Phone: A Novel and Efficient Method for Training Speaker Recognition Models},
author = {Edresson Casanova and Arnaldo Candido Junior and Christopher Shulby and Frederico Santos de Oliveira and Lucas Rafael Stefanel Gris and Hamilton Pereira da Silva and Sandra Maria Aluisio and Moacir Antonelli Ponti},
journal= {arXiv preprint arXiv:2002.11213},
year = {2021}
}
备注
Submitted to BRACIS