中文

用于文本无关说话人验证的自适应X-vector模型

音频与语音处理 2025-12-18 v1 信号处理

摘要

在本文中,自适应机制被应用于基于x-vector的文本无关说话人验证的深度神经网络(DNN)训练中。首先,在帧级嵌入层中采用自适应卷积神经网络(ACNN),其中卷积滤波器的参数根据输入特征进行调整。与传统CNN相比,ACNN在捕获说话人信息方面具有更大的灵活性。此外,我们用自适应批归一化(ABN)替换了传统的批归一化(BN)。通过动态生成BN中的缩放和平移参数,ABN使模型适应由信道和环境噪声等各种因素引起的声学变异性。最后,我们结合这两种方法以进一步提高性能。在Speaker in the Wild(SITW)和VOiCES数据库上进行了实验。结果表明,所提出的方法显著优于原始的x-vector方法。

关键词

引用

@article{arxiv.2002.06049,
  title  = {An Adaptive X-vector Model for Text-independent Speaker Verification},
  author = {Bin Gu and Wu Guo and Lirong Dai and Jun Du},
  journal= {arXiv preprint arXiv:2002.06049},
  year   = {2025}
}

备注

6 pages, 3 figures