中文

用于多头自注意力说话人确认系统的类令牌与知识蒸馏方法

音频与语音处理 2023-02-13 v2 机器学习 声音

摘要

本文探讨了三种基于深度神经网络(DNN)、利用多头自注意力(MSA)机制和记忆层来改进说话人确认(SV)系统性能的新方法。首先,我们提出使用称为类令牌(class token)的可学习向量来替代平均全局池化机制以提取嵌入向量。与全局平均池化不同,我们的方案考虑了输入的时间结构,这对于文本相关SV任务是相关的。类令牌在第一个MSA层之前与输入拼接,其在输出处的状态用于预测类别。为获得额外的鲁棒性,我们引入了两种方法。首先,我们开发了类令牌的贝叶斯估计。其次,我们添加了一个蒸馏表示令牌,用于基于知识蒸馏(KD)思想训练师生网络对,并与类令牌结合。该蒸馏令牌被训练以模仿教师网络的预测,而类令牌复制真实标签。所有策略已在RSR2015-Part II和DeepMine-Part 1数据库上针对文本相关SV进行了测试,与使用平均池化机制提取平均嵌入的相同架构相比,提供了具有竞争力的结果。

关键词

引用

@article{arxiv.2111.03842,
  title  = {Class Token and Knowledge Distillation for Multi-head Self-Attention Speaker Verification Systems},
  author = {Victoria Mingote and Antonio Miguel and Alfonso Ortega and Eduardo Lleida},
  journal= {arXiv preprint arXiv:2111.03842},
  year   = {2023}
}