用于文本无关说话人验证的端到端可训练自注意力浅层网络
音频与语音处理
2020-08-17 v1 计算与语言
声音
摘要
广义端到端(GE2E)模型因其可扩展性与通用性(不受特定语言限制)而广泛应用于说话人验证(SV)领域。然而,基于 GE2E 的长短期记忆(LSTM)有两个局限:首先,GE2E 的嵌入存在梯度消失问题,导致对极长输入序列性能下降。其次,语音段未被表示为适当固定维度的向量。在本文中,为克服上述问题,我们提出一种用于 SV 的新框架——端到端可训练自注意力浅层网络(SASN),在语音段嵌入阶段结合了时延神经网络(TDNN)与基于自注意力 x-vector 系统的自注意力池化机制。我们证明所提模型高效,且比 GE2E 提供更准确的说话人验证。在 VCTK 数据集上,所提模型规模不到 GE2E 的一半,却在 EER(等错误率)、DCF(检测代价函数)和 AUC(曲线下面积)上分别较 GE2E 显著提升约 63%、67% 和 85%。值得注意的是,当输入长度变长时,所提模型的 DCF 分数提升约为 GE2E 的 17 倍。
引用
@article{arxiv.2008.06146,
title = {End-to-End Trainable Self-Attentive Shallow Network for Text-Independent Speaker Verification},
author = {Hyeonmook Park and Jungbae Park and Sang Wan Lee},
journal= {arXiv preprint arXiv:2008.06146},
year = {2020}
}
备注
5 pages, 3 figures, 3 tables