中文

用于神经说话人嵌入的串行多层多头注意力

声音 2021-07-15 v1 计算与语言 音频与语音处理

摘要

本文提出一种用于文本无关说话人验证中神经说话人嵌入的串行多层多头注意力。在先前工作中,来自一层的帧级特征被聚合以形成 utterance 级表示。受Transformer网络启发,我们提出的方法利用堆叠自注意力机制的层次化架构来推导与说话人更相关的精炼特征。串行注意力机制包含一堆自注意力模块以创建固定维的说话人表示。所提串行多层多头注意力并非并行利用多头注意力,而是设计成以串行方式从一层聚合并传播注意力统计量到下一层。此外,我们结合统计量池化对每个 utterance 采用输入感知的查询。随着堆叠层数增加,神经网络可学习更具判别性的说话人嵌入。在VoxCeleb1数据集与SITW数据集上的实验结果表明,我们提出的方法在EER上优于其他基线方法(包括x-vectors及其他x-vectors+常规注意力池化方法)9.7%,在DCF0.01上优于8.1%。

关键词

引用

@article{arxiv.2107.06493,
  title  = {Serialized Multi-Layer Multi-Head Attention for Neural Speaker Embedding},
  author = {Hongning Zhu and Kong Aik Lee and Haizhou Li},
  journal= {arXiv preprint arXiv:2107.06493},
  year   = {2021}
}

备注

Accepted by Interspeech 2021