利用 w2v-BERT 2.0 和由知识蒸馏引导的结构化剪枝提升说话人验证
音频与语音处理
2026-03-10 v3 声音
摘要
大规模自监督预训练模型(PTM)已在说话人验证(SV)任务中显著提升,因能提供丰富的特征表示。本文利用约有 6 亿参数、在 143 种语言、450 万小时无标签数据上训练得到的 w2v-BERT 2.0 用于 SV 任务。采用包含 Layer Adapter 的 MFA 结构来处理 PTM 的多层特征输出并提取说话人嵌入。此外,我们引入 LoRA 实现高效微调。我们的模型在 Vox1-O 和 Vox1-H 测试集上分别实现了 0.12% 和 0.55% 的 EER,达到最新成果。进一步,我们应用由知识蒸馈引导的结构化剪枝,在仅降低 0.04% EER 的情况下将模型规模缩减 80%。源代码和模型已发布于 https://github.com/ZXHY-82/w2v-BERT-2.0_SV。
引用
@article{arxiv.2510.04213,
title = {Enhancing Speaker Verification with w2v-BERT 2.0 and Knowledge Distillation guided Structured Pruning},
author = {Ze Li and Ming Cheng and Ming Li},
journal= {arXiv preprint arXiv:2510.04213},
year = {2026}
}