用于说话人识别的自注意力编码与池化
音频与语音处理
2020-08-05 v1 机器学习
声音
摘要
移动设备的计算能力在存储大小、处理、内存和能耗方面限制了终端用户应用。这些限制促使研究者设计更高效的深度模型。另一方面,基于 Transformer 架构的自注意力网络因其高度并行化能力以及在多种自然语言处理(NLP)应用上的强劲表现而引起了显著关注。受 Transformer 启发,我们提出一种串联的自注意力编码与池化(SAEP)机制,以在给定非定长语音片段时获得具有判别性的说话人嵌入。SAEP 是一堆叠相同的块,仅依赖自注意力和位置前馈网络来创建说话人的向量表示。该方法将短时说话人谱特征编码为说话人嵌入,用于文本无关的说话人验证。我们在 VoxCeleb1 和 VoxCeleb2 数据集上评估了该方法。所提架构能够超越基线 x-vector,并与一些基于卷积的其他基准表现出竞争性能,同时模型大小显著减小。与 ResNet-34、ResNet-50 和 x-vector 相比,它分别减少了 94%、95% 和 73% 的参数。这表明所提出的全注意力架构在从说话人语音中提取时间不变特征方面更高效。
引用
@article{arxiv.2008.01077,
title = {Self-attention encoding and pooling for speaker recognition},
author = {Pooyan Safari and Miquel India and Javier Hernando},
journal= {arXiv preprint arXiv:2008.01077},
year = {2020}
}