中文

P-vectors:一种用于说话人验证的并行耦合TDNN/Transformer网络

音频与语音处理 2023-05-26 v2 声音

摘要

通常,时延神经网络(TDNN)与Transformer可作为说话人验证(SV)的骨干网络。从全局与局部特征建模的角度看,二者各有优劣。如何有效融合这两类风格的特征仍是一个开放问题。本文探索了一种并行耦合TDNN/Transformer网络(p-vectors)以替代串行混合网络。p-vectors在保留局部与全局特征的前提下,通过软特征对齐交互(SFAI)使TDNN与Transformer相互学习互补信息。同时,p-vectors利用空间频率通道注意力(SFA)增强对输入特征的空间相互依赖建模。最后,p-vectors的双分支输出由嵌入聚合层(EAL)进行组合。实验表明,在VoxCeleb1-O上,p-vectors的EER相对MACCIF-TDNN和MFA-Conformer分别提升11.5%和13.9%。

关键词

引用

@article{arxiv.2305.14778,
  title  = {P-vectors: A Parallel-Coupled TDNN/Transformer Network for Speaker Verification},
  author = {Xiyuan Wang and Fangyuan Wang and Bo Xu and Liang Xu and Jing Xiao},
  journal= {arXiv preprint arXiv:2305.14778},
  year   = {2023}
}

备注

Accepted by INTERSPEECH 2023