中文

基于重编程与后端学习的高效黑盒说话人验证模型自适应

音频与语音处理 2023-09-26 v1 声音

摘要

深度神经网络(DNN)的发展近年来显著提升了说话人验证(SV)系统的性能。然而,在实用中应用基于DNN的SV系统时,一个持续存在的关键问题是域不匹配。为缓解由不匹配引起的性能退化,域自适应变得必要。本文受对抗重编程概念启发,提出一种通过操控可学习模型输入来自适应基于DNN的SV模型的方法。预训练SV模型保持固定且仅在前向过程中起作用,类似于黑盒模型。利用轻量网络估计输入处可学习参数的梯度,从而绕过通过黑盒模型的梯度反向传播。重编程输出由两层后端学习模块处理作为最终自适应说话人嵌入。我们设计中涉及梯度计算的参数量很小。借助极少的额外参数,所提方法实现了内存与参数的双重高效。实验在语言不匹配场景下开展。以低得多的计算代价,所提方法在实验中取得与全微调模型相近或更优的性能,证明了其有效性。

关键词

引用

@article{arxiv.2309.13605,
  title  = {Efficient Black-Box Speaker Verification Model Adaptation with Reprogramming and Backend Learning},
  author = {Jingyu Li and Tan Lee},
  journal= {arXiv preprint arXiv:2309.13605},
  year   = {2023}
}