用于文本无关说话人验证的深度多度量学习
音频与语音处理
2020-07-22 v1 计算机视觉与模式识别
声音
摘要
文本无关说话人验证是一个重要的人工智能问题,具有广泛的应用,如刑事调查、支付认证和基于兴趣的客户服务。文本无关说话人验证的目的是判断两个给定的非受控语音是否来自同一说话人。利用深度神经网络为每个说话人提取语音特征是一个有前景的探索方向,直接解决方案是使用度量学习损失函数训练判别性特征提取网络。然而,单一损失函数往往存在某些局限。因此,我们使用深度多度量学习来解决该问题,并为该问题引入三种不同损失,即三元组损失、n-pair 损失和角度损失。这三种损失函数以协作方式训练配备残差连接和压缩激励注意力机制的特征提取网络。我们在大规模 VoxCeleb2 数据集上开展实验,该数据集包含来自超过 6,000 个说话人的逾百万条语音,所提深度神经网络取得了 3.48% 的等错误率,这是一个极具竞争力的结果。训练和测试代码及预训练模型可在 https://github.com/GreatJiweix/DmmlTiSV 获取,这是首个公开可用的、性能与最先进系统相当的大规模文本无关说话人验证代码仓库。
引用
@article{arxiv.2007.10479,
title = {Deep multi-metric learning for text-independent speaker verification},
author = {Jiwei Xu and Xinggang Wang and Bin Feng and Wenyu Liu},
journal= {arXiv preprint arXiv:2007.10479},
year = {2020}
}