用于说话人表征学习的多频信息增强通道注意力模块
音频与语音处理
2022-07-12 v1 机器学习
声音
摘要
近年来,注意力机制已成功应用于基于神经网络的说话人验证系统。将Squeeze-and-Excitation模块融入卷积神经网络已取得显著性能。然而,其使用全局平均池化(GAP)沿时间和频率维度简单平均特征,无法在特征图中保留充分的说话人信息。本研究中,我们从数学上证明GAP是时频域上离散余弦变换(DCT)仅使用频率分解中最低频率分量的特例。为增强说话人信息提取能力,我们提出利用多频信息并设计两种新颖有效的注意力模块,称为单频单通道(SFSC)注意力模块和多频单通道(MFSC)注意力模块。所提注意力模块能够在DCT基础上从多个频率分量中有效捕获更多说话人信息。我们在VoxCeleb数据集上进行了全面实验,并在首届48-UTD法医语料库上进行了探查评估。实验结果表明,我们提出的SFSC和MFSC注意力模块能高效生成更具判别性的说话人表征,并在EER上相对降低20.9%和20.2%,优于ResNet34-SE和ECAPA-TDNN系统,且不增加额外网络参数。
引用
@article{arxiv.2207.04540,
title = {Multi-Frequency Information Enhanced Channel Attention Module for Speaker Representation Learning},
author = {Mufan Sang and John H. L. Hansen},
journal= {arXiv preprint arXiv:2207.04540},
year = {2022}
}
备注
Accepted to Interspeech 2022