MFA-Conformer:用于自动说话人验证的多尺度特征聚合Conformer
声音
2022-11-14 v2 音频与语音处理
摘要
本文提出多尺度特征聚合Conformer(MFA-Conformer),一种基于卷积增强Transformer(Conformer)的、易于实现且简单有效的自动说话人验证骨干网络。MFA-Conformer的架构受到语音识别和说话人验证领域近期最先进模型的启发。首先,我们引入卷积下采样层以降低模型的计算成本。其次,我们采用Conformer块,其结合了Transformers与卷积神经网络(CNNs),以有效捕获全局与局部特征。最后,在所有Conformer块的输出特征图进行最终池化之前将其拼接,以聚合多尺度表示。我们在广泛使用的基准上评估了MFA-Conformer。最佳系统在VoxCeleb1-O、SITW.Dev和SITW.Eval集上分别取得了0.64%、1.29%和1.63%的EER。MFA-Conformer在识别性能和推理速度上均显著优于流行的ECAPA-TDNN系统。最后同样重要的是,消融研究清楚地表明,全局与局部特征学习的结合可带来鲁棒且准确的说话人嵌入提取。我们已发布代码以供未来对比。
引用
@article{arxiv.2203.15249,
title = {MFA-Conformer: Multi-scale Feature Aggregation Conformer for Automatic Speaker Verification},
author = {Yang Zhang and Zhiqiang Lv and Haibin Wu and Shanshan Zhang and Pengfei Hu and Zhiyong Wu and Hung-yi Lee and Helen Meng},
journal= {arXiv preprint arXiv:2203.15249},
year = {2022}
}
备注
accepted by INTERSPEECH 2022