中文

SE/BN 适配器:面向说话人识别的参数化高效领域适应

声音 2024-06-13 v1 音频与语音处理

摘要

将经过优化的预训练说话人识别模型部署到新领域时,常会导致性能显著下降。虽然微调是常用的解决方案,但它需要大量适配数据且参数效率低下,在数据有限的实际应用场景中往往不可行。本文灵感来源于适配器在自监督预训练模型中的成功,引入 SE/BN 适配器以解决此挑战。通过冻结核心说话人编码器并调整特征图的权重和激活分布,我们提出了一种新型适配器,采用可训练的 squeeze-and-excitation(SE)模块和 batch normalization(BN)层,称为 SE/BN 适配器。我们的实验使用 VoxCeleb 进行预训练,CN-Celeb 的 4 个音乐流派进行适配,结果显示 SE/BN 适配器在基线模型和仅调节 1% 参数的 vanilla 微调方法中均表现出显著性能提升。

关键词

引用

@article{arxiv.2406.07832,
  title  = {SE/BN Adapter: Parametric Efficient Domain Adaptation for Speaker Recognition},
  author = {Tianhao Wang and Lantian Li and Dong Wang},
  journal= {arXiv preprint arXiv:2406.07832},
  year   = {2024}
}

备注

to be published in INTERSPEECH 2024