基于卷积的信道-频率注意力用于文本无关说话人验证
音频与语音处理
2022-11-01 v1 声音
摘要
深度卷积神经网络(CNNs)已成功应用于提取说话人嵌入以进行说话人验证。引入注意力机制已被证明能有效提升模型性能。本文提出一种高效的基于二维卷积的注意力模块,即 C2D-Att。卷积信道与频率之间的交互通过轻量卷积层参与注意力计算,这仅需少量参数。细粒度注意力权重被生成以表征信道与频率特定信息。这些权重作用于输入特征以提升说话人建模的表示能力。C2D-Att 被集成到改进版 ResNet 中以提取说话人嵌入。实验在 VoxCeleb 数据集上进行。结果表明 C2DAtt 能有效生成具判别性的注意力图,并优于其他注意力方法。所提模型在不同模型规模下均表现鲁棒,并取得了当前最优结果。
引用
@article{arxiv.2210.17310,
title = {Convolution-Based Channel-Frequency Attention for Text-Independent Speaker Verification},
author = {Jingyu Li and Yusheng Tian and Tan Lee},
journal= {arXiv preprint arXiv:2210.17310},
year = {2022}
}