用于说话人识别的监督注意力
声音
2020-12-04 v2 音频与语音处理
摘要
近期提出的自注意力池化(SAP)在若干说话人识别系统中展现出良好性能。在 SAP 系统中,上下文向量与特征提取器端到端联合训练,其中上下文向量的作用是选择最具判别性的帧用于说话人识别。然而,在某些设定下 SAP 表现不及时序平均池化(TAP)基线,这意味着端到端训练中注意力未被有效学习。为解决此问题,我们引入以监督方式训练注意力机制的策略,其使用分类样本学习上下文向量。借助所提方法,上下文向量可增强以选择信息量最大的帧。我们展示该方法在包括短语音说话人识别的多种实验设定下优于现有方法,并在 VoxCeleb 数据集上取得与现有基线具竞争力的性能。
引用
@article{arxiv.2011.05189,
title = {Supervised attention for speaker recognition},
author = {Seong Min Kye and Joon Son Chung and Hoirin Kim},
journal= {arXiv preprint arXiv:2011.05189},
year = {2020}
}
备注
SLT 2021