基于 3D-CNN 的小样本文本无关说话人验证
音频与语音处理
2020-08-26 v1 机器学习
声音
摘要
人脸识别系统是人工智能的重大成功之一,并在过去几年中被大量使用。但是,图像并非唯一的生物特征:音频是另一种可能的生物特征,可用作现有识别系统的替代方案。然而,对于说话人验证等任务,文本无关的音频数据并不总是可得,且以往在假设极少训练数据的情况下,尚未有针对文本无关说话人验证的研究。因此,本文提出了一种利用极少训练数据验证声称说话人身份的新方法。为此,我们使用带有中心损失和说话人偏置损失的孪生神经网络。在 VoxCeleb1 数据集上的实验表明,所提模型即使在极少数据训练下,其准确率也接近文本无关说话人验证的 SOTA 模型。
引用
@article{arxiv.2008.11088,
title = {Few Shot Text-Independent speaker verification using 3D-CNN},
author = {Prateek Mishra},
journal= {arXiv preprint arXiv:2008.11088},
year = {2020}
}
备注
7 pages, 2 figures