中文

基于双注意力网络的文本无关说话人验证

音频与语音处理 2020-09-14 v1

摘要

本文提出一种用于文本无关说话人验证的注意力模型新设计。该模型接收一对输入语音,并生成话语级嵌入以表示各语音中的说话人特定特征。若输入语音来自同一说话人,则其嵌入应高度相似。所提注意力模型由自注意力模块与互注意力模块组成,共同作用于话语级嵌入的生成。自注意力权重由话语自身计算,而互注意力权重则通过输入对中的另一话语参与计算。因此,每句语音由自注意力加权嵌入与互注意力加权嵌入表示。嵌入间的相似性通过余弦距离分数与二分类器输出分数度量。整个模型称为双注意力网络(Dual Attention Network),在 Voxceleb 数据库上端到端训练。在 Voxceleb 1 测试集上的评估结果表明,双注意力网络显著优于基线系统。最佳结果取得 1.6% 的等错误率。

关键词

引用

@article{arxiv.2009.05485,
  title  = {Text-Independent Speaker Verification with Dual Attention Network},
  author = {Jingyu Li and Tan Lee},
  journal= {arXiv preprint arXiv:2009.05485},
  year   = {2020}
}