突破原始波形说话人识别的极限
音频与语音处理
2022-03-30 v2 人工智能
摘要
近年来,基于原始波形输入的说话人识别系统受到越来越多的关注。然而,此类系统的性能通常劣于最先进的基于手工特征的方法,后者在流行的 VoxCeleb1 测试集上取得了低于 1% 的等错误率。本文提出了一种基于原始波形输入的新型说话人识别模型。该模型融合了机器学习与说话人验证的最新进展,包括 Res2Net 骨干模块和多层特征聚合。我们的最佳模型取得了 0.89% 的等错误率,与基于手工特征的最先进模型相当,并大幅优于基于原始波形输入的最佳模型。我们还探索了该模型在自监督学习框架下的应用。我们的自监督模型优于该研究方向中现有的基于单相的方法。最后,我们表明自监督预训练在半监督场景下是有效的,即我们仅拥有一小部分带标签的训练数据以及更大规模的无标签样本。
引用
@article{arxiv.2203.08488,
title = {Pushing the limits of raw waveform speaker recognition},
author = {Jee-weon Jung and You Jin Kim and Hee-Soo Heo and Bong-Jin Lee and Youngki Kwon and Joon Son Chung},
journal= {arXiv preprint arXiv:2203.08488},
year = {2022}
}
备注
submitted to INTERSPEECH 2022 as a conference paper. 5 pages, 2 figures, 5 tables