中文

用于说话人验证的双重多头注意力

音频与语音处理 2021-01-12 v2 声音

摘要

大多数用于说话人验证的 SOTA 深度学习系统基于说话人嵌入提取器。这些架构通常由特征提取器前端和池化层组成,用于将变长语音编码为定长说话人向量。在本文中,我们提出了双重多头注意力池化,它扩展了我们之前基于自多头注意力的方法。在池化层中添加了一个额外的自注意力层,将多头注意力生成的上下文向量汇总为唯一的说话人表示。该方法通过为每个头捕获的信息赋予权重来增强池化机制,从而生成更具判别力的说话人嵌入。我们使用 VoxCeleb2 数据集评估了我们的方法。结果表明,与自注意力池化和自多头注意力相比,EER 分别获得了 6.09% 和 5.23% 的相对提升。根据所得结果,双重多头注意力已被证明是一种出色的方法,能够高效地从语音信号中选出基于 CNN 前端捕获的最相关特征。

关键词

引用

@article{arxiv.2007.13199,
  title  = {Double Multi-Head Attention for Speaker Verification},
  author = {Miquel India and Pooyan Safari and Javier Hernando},
  journal= {arXiv preprint arXiv:2007.13199},
  year   = {2021}
}