ECAPA-TDNN:基于 TDNN 说话人验证中的强调通道注意力、传播与聚合
音频与语音处理
2020-11-03 v3 声音
摘要
当前的说话人验证技术依赖于神经网络来提取说话人表征。成功的 x-vector 架构是一种时间延迟神经网络(TDNN),其应用统计池化将变长语音投影为固定长度的说话人刻画嵌入。在本文中,我们基于人脸验证与计算机视觉相关领域的近期趋势,对该架构提出多项增强。首先,初始帧层可重构为具有显著跳跃连接的 1 维 Res2Net 模块。类似于 SE-ResNet,我们在这些模块中引入压缩激励(Squeeze-and-Excitation)块以显式建模通道间依赖关系。SE 块根据录音的全局属性重新缩放通道,从而扩展帧层的时间上下文。其次,已知神经网络学习层次化特征,每一层在不同复杂度水平上运作。为利用这一互补信息,我们聚合并传播不同层次级别的特征。最后,我们通过通道依赖的帧注意力改进统计池化模块。这使得网络在每一通道的统计估计过程中聚焦于不同的帧子集。所提出的 ECAPA-TDNN 架构在 VoxCeleb 测试集与 2019 VoxCeleb 说话人识别挑战赛上显著优于最先进的基于 TDNN 的系统。
引用
@article{arxiv.2005.07143,
title = {ECAPA-TDNN: Emphasized Channel Attention, Propagation and Aggregation in TDNN Based Speaker Verification},
author = {Brecht Desplanques and Jenthe Thienpondt and Kris Demuynck},
journal= {arXiv preprint arXiv:2005.07143},
year = {2020}
}
备注
proceedings of INTERSPEECH 2020