中文

MCSAE:用于说话人嵌入的掩码交叉自注意力编码

音频与语音处理 2020-07-29 v4 机器学习 声音 机器学习

摘要

通常,自注意力机制已被应用于说话人嵌入编码。以往研究侧重于在高层级(如最后的池化层)训练自注意力,然而低层特征在说话人嵌入编码中的效用被削弱。因此,我们提出使用 ResNet 的掩码交叉自注意力编码(MCSAE),其关注高层级与低层级两者的特征。基于多层聚合,每个残差层的输出特征被用于 MCSAE。在 MCSAE 中,交叉自注意力模块训练各输入特征间的相互依赖关系。还应用了随机掩码正则化模块以防止过拟合问题。由此,MCSAE 增强了表征说话人信息的帧的权重,随后将输出特征拼接并编码为说话人嵌入。因此,通过 MCSAE 编码得到信息更丰富的说话人嵌入。实验结果表明,在 VoxCeleb1 评估数据集上等错误率为 2.63%,最小检测代价函数为 0.1453,相较于以往的自注意力编码与最先进(SOTA)编码方法均有性能提升。

关键词

引用

@article{arxiv.2001.10817,
  title  = {MCSAE: Masked Cross Self-Attentive Encoding for Speaker Embedding},
  author = {Soonshin Seo and Ji-Hwan Kim},
  journal= {arXiv preprint arXiv:2001.10817},
  year   = {2020}
}

备注

5 pages, 3 figures, 4 tables