中文

通过引入局部性改进基于 Transformer 的网络用于自动说话人验证

音频与语音处理 2023-03-02 v2 机器学习 声音

摘要

近来,基于 Transformer 的架构已被探索用于说话人嵌入提取。尽管 Transformer 采用自注意力机制高效建模 token 嵌入间的全局交互,但其不足以捕捉短程局部上下文,而后者对于准确提取说话人信息至关重要。在本研究中,我们从两个方向增强 Transformer 的局部性建模。首先,我们通过将深度可分离卷积与通道注意力引入 Conformer 块,提出局部性增强 Conformer (LE-Conformer)。其次,我们通过将最初为视觉任务提出的 Swin Transformer 适配为说话人嵌入网络,提出说话人 Swin Transformer (SST)。我们在 VoxCeleb 数据集与大规模微软内部多语言 (MS-internal) 数据集上评估所提方法。所提模型在 VoxCeleb 1 测试集上取得 0.75% EER,优于先前提出的基于 Transformer 的模型及基于 CNN 的模型,如 ResNet34 与 ECAPA-TDNN。当在 MS-internal 数据集上训练时,所提模型取得可观结果,相较 Res2Net50 模型 EER 相对降低 14.6%。

关键词

引用

@article{arxiv.2302.08639,
  title  = {Improving Transformer-based Networks With Locality For Automatic Speaker Verification},
  author = {Mufan Sang and Yong Zhao and Gang Liu and John H. L. Hansen and Jian Wu},
  journal= {arXiv preprint arXiv:2302.08639},
  year   = {2023}
}

备注

Accepted to ICASSP 2023