中文

通过迁移学习与知识蒸馏利用 ASR 预训练 Conformer 进行说话人验证

音频与语音处理 2024-07-17 v2

摘要

本文探索了使用 ASR 预训练的 Conformer 进行说话人验证,借力其在语音信号建模上的优势。我们引入了三种策略:(1)迁移学习以初始化说话人嵌入网络,改善泛化并减少过拟合。(2)知识蒸馏以训练更灵活的说话人验证模型,将帧级 ASR 损失作为辅助任务纳入。(3)轻量说话人适配器,用于高效特征转换而不改动原始 ASR Conformer,从而允许并行 ASR 与说话人验证。在 VoxCeleb 上的实验显示出显著改进:迁移学习取得 0.48% EER,知识蒸馏得到 0.43% EER,而说话人适配器方法仅向 130.94M 参数的模型添加 4.92M 参数,即达到 0.57% EER。总体而言,我们的方法有效地将 ASR 能力迁移至说话人验证任务。

关键词

引用

@article{arxiv.2309.03019,
  title  = {Leveraging ASR Pretrained Conformers for Speaker Verification through Transfer Learning and Knowledge Distillation},
  author = {Danwei Cai and Ming Li},
  journal= {arXiv preprint arXiv:2309.03019},
  year   = {2024}
}

备注

Published in: IEEE/ACM Transactions on Audio, Speech, and Language Processing