中文

面向端到端说话人确认系统的带特征重标定与归一化的自注意力多层聚合

音频与语音处理 2020-07-29 v2 机器学习 声音

摘要

端到端说话人确认系统中最重要的部分之一是说话人嵌入的生成。在我们之前的论文中,我们报道了基于快捷连接的多层聚合提升了说话人嵌入的表征能力。然而,模型参数量相对较大,且多层聚合中未指定的变化增多。因此,我们提出了一种面向端到端说话人确认系统的带特征重标定与归一化的自注意力多层聚合。为减少模型参数量,采用缩放了通道宽度和层深度的ResNet作为基线。为控制训练中的变异性,应用自注意力机制执行带dropout正则化和batch normalization的多层聚合。随后,使用全连接层和非线性激活函数对聚合特征施加特征重标定层。在端到端训练过程中,还对重标定特征使用了深度长度归一化。使用VoxCeleb1评估数据集的实验结果表明,所提方法的性能可与最先进模型相媲美(使用VoxCeleb1和VoxCeleb2训练数据集时等错误率分别为4.95%和2.86%)。

关键词

引用

@article{arxiv.2007.13350,
  title  = {Self-Attentive Multi-Layer Aggregation with Feature Recalibration and Normalization for End-to-End Speaker Verification System},
  author = {Soonshin Seo and Ji-Hwan Kim},
  journal= {arXiv preprint arXiv:2007.13350},
  year   = {2020}
}

备注

5 pages, 1 figures, 4 tables