中文

ECAPA2:一种用于鲁棒说话人嵌入的混合神经网络架构与训练策略

音频与语音处理 2024-01-17 v1

摘要

本文提出 ECAPA2,一种新颖的混合神经网络架构与训练策略,用于生成鲁棒的说话人嵌入。大多数说话人验证模型基于一维或二维卷积操作,通常分别表现为时延神经网络或 ResNet。混合模型相对未被充分探索,且缺乏关于其架构选择最佳实践的直观解释。本文通过对当前说话人验证架构的分析,阐述了所提出的 ECAPA2 模型的动机。此外,我们提出了一种训练策略,使说话人嵌入对重叠语音和短语音段长度更具鲁棒性。所提出的 ECAPA2 架构与训练策略在 VoxCeleb1 测试集上以显著少于当前模型的参数量达到了最先进的性能。最后,我们公开了一个预训练模型,以促进下游任务的研究。

关键词

引用

@article{arxiv.2401.08342,
  title  = {ECAPA2: A Hybrid Neural Network Architecture and Training Strategy for Robust Speaker Embeddings},
  author = {Jenthe Thienpondt and Kris Demuynck},
  journal= {arXiv preprint arXiv:2401.08342},
  year   = {2024}
}

备注

proceedings of ASRU 2023