使用大型预训练自监督学习模型进行说话人验证的一步知识蒸馏与微调
音频与语音处理
2023-06-09 v2 声音
摘要
语音自监督学习(SSL)模型的应用在说话人验证(SV)中取得了卓越性能。然而,采用它们存在计算成本障碍,使得开发与部署困难。若干研究仅通过知识蒸馏(KD)简单压缩SSL模型而未考虑目标任务。因此,这些方法无法提取面向SV的特征。本文提出一步知识蒸馏与微调(OS-KDFT),其结合了KD与微调(FT)。我们在KD训练期间针对SV优化学生模型,以避免对SV不适当信息的蒸馏。OS-KDFT可将基于Wav2Vec 2.0的ECAPA-TDNN规模缩减约76.2%,并将SSL模型的推理时间减少79%,同时呈现0.98%的EER。所提OS-KDFT在VoxCeleb1与VoxCeleb2数据集以及W2V2和HuBERT SSL模型上得到验证。实验可在我们的GitHub上获取。
引用
@article{arxiv.2305.17394,
title = {One-Step Knowledge Distillation and Fine-Tuning in Using Large Pre-Trained Self-Supervised Learning Models for Speaker Verification},
author = {Jungwoo Heo and Chan-yeong Lim and Ju-ho Kim and Hyun-seo Shin and Ha-Jin Yu},
journal= {arXiv preprint arXiv:2305.17394},
year = {2023}
}
备注
ISCA INTERSPEECH 2023