说话人识别中的注意力机制:深度说话人嵌入学到了什么?
声音
2018-09-26 v1 音频与语音处理
摘要
本文对带有注意力机制的深度说话人嵌入进行了实验研究,该机制已被发现是说话人识别中一种强大的表示学习技术。在此框架中,注意力模型充当帧选择器,为每一帧级特征向量计算注意力权重,并依据该权重在说话人嵌入网络的池化层产生 utterance 级表示。一般而言,注意力模型与说话人嵌入网络在单一目标函数上联合训练,因此这两个组件紧密绑定。在本文中,我们考虑注意力模型可能从其父网络解耦,并辅助其他说话人嵌入网络甚至传统的 i-vector 提取器的可能性。这一系列可能性通过在 NIST 说话人识别评测(SRE)任务上的一系列实验得到证明:当注意力权重应用于 i-vector 提取时,EER 降低 9.0%,min_Cprimary 降低 3.8%。另一实验表明,基于 DNN 的软语音活动检测(VAD)可有效与注意力机制结合,在深度说话人嵌入与 i-vector 系统中分别进一步使 minCprimary 降低 6.6% 与 1.6%。
引用
@article{arxiv.1809.09311,
title = {Attention Mechanism in Speaker Recognition: What Does It Learn in Deep Speaker Embedding?},
author = {Qiongqiong Wang and Koji Okabe and Kong Aik Lee and Hitoshi Yamamoto and Takafumi Koshinaka},
journal= {arXiv preprint arXiv:1809.09311},
year = {2018}
}
备注
SLT 2018 (Workshop on Spoken Language Technology)