ECAPA2:一种用于鲁棒说话人嵌入的混合神经网络架构与训练策略
音频与语音处理
2024-01-17 v1
摘要
本文提出 ECAPA2,一种新颖的混合神经网络架构与训练策略,用于生成鲁棒的说话人嵌入。大多数说话人验证模型基于一维或二维卷积操作,通常分别表现为时延神经网络或 ResNet。混合模型相对未被充分探索,且缺乏关于其架构选择最佳实践的直观解释。本文通过对当前说话人验证架构的分析,阐述了所提出的 ECAPA2 模型的动机。此外,我们提出了一种训练策略,使说话人嵌入对重叠语音和短语音段长度更具鲁棒性。所提出的 ECAPA2 架构与训练策略在 VoxCeleb1 测试集上以显著少于当前模型的参数量达到了最先进的性能。最后,我们公开了一个预训练模型,以促进下游任务的研究。
引用
@article{arxiv.2401.08342,
title = {ECAPA2: A Hybrid Neural Network Architecture and Training Strategy for Robust Speaker Embeddings},
author = {Jenthe Thienpondt and Kris Demuynck},
journal= {arXiv preprint arXiv:2401.08342},
year = {2024}
}
备注
proceedings of ASRU 2023