P-vectors:一种用于说话人验证的并行耦合TDNN/Transformer网络
音频与语音处理
2023-05-26 v2 声音
摘要
通常,时延神经网络(TDNN)与Transformer可作为说话人验证(SV)的骨干网络。从全局与局部特征建模的角度看,二者各有优劣。如何有效融合这两类风格的特征仍是一个开放问题。本文探索了一种并行耦合TDNN/Transformer网络(p-vectors)以替代串行混合网络。p-vectors在保留局部与全局特征的前提下,通过软特征对齐交互(SFAI)使TDNN与Transformer相互学习互补信息。同时,p-vectors利用空间频率通道注意力(SFA)增强对输入特征的空间相互依赖建模。最后,p-vectors的双分支输出由嵌入聚合层(EAL)进行组合。实验表明,在VoxCeleb1-O上,p-vectors的EER相对MACCIF-TDNN和MFA-Conformer分别提升11.5%和13.9%。
引用
@article{arxiv.2305.14778,
title = {P-vectors: A Parallel-Coupled TDNN/Transformer Network for Speaker Verification},
author = {Xiyuan Wang and Fangyuan Wang and Bo Xu and Liang Xu and Jing Xiao},
journal= {arXiv preprint arXiv:2305.14778},
year = {2023}
}
备注
Accepted by INTERSPEECH 2023