用于说话人验证的频率与多尺度选择性核注意力
音频与语音处理
2022-10-13 v4 人工智能
摘要
近期大多数最先进的说话人验证架构都采用了多尺度处理和频率-通道注意力机制。这些模型的卷积层通常具有固定的核大小,例如 3 或 5。在本研究中,我们进一步利用选择性核注意力(SKA)机制推进了这一研究方向。SKA 机制允许每个卷积层以数据驱动的方式自适应地选择核大小。它基于一种同时利用频率和通道域的注意力机制。我们首先将已有的 SKA 模块应用于我们的基线模型。随后我们提出两种 SKA 变体,其中第一种变体应用于 ECAPA-TDNN 模型之前,另一种与 Res2net 骨干块相结合。通过大量实验,我们证明了我们所提出的两种 SKA 变体能够持续提升性能,并且在三种不同的评估协议下测试时具有互补性。
引用
@article{arxiv.2204.01005,
title = {Frequency and Multi-Scale Selective Kernel Attention for Speaker Verification},
author = {Sung Hwan Mun and Jee-weon Jung and Min Hyun Han and Nam Soo Kim},
journal= {arXiv preprint arXiv:2204.01005},
year = {2022}
}
备注
Accepted by IEEE SLT 2022. 7 pages, 4 figures, 1 table. Code is available at https://github.com/msh9184/ska-tdnn.git