面向小 footprint 说话人确认的多级 X-vector 知识蒸馏
声音
2023-12-21 v3 机器学习
音频与语音处理
摘要
尽管深度说话人模型在说话人确认任务中展现出令人印象深刻的准确率,但这往往以模型尺寸增大与计算时间增加为代价,给在资源受限环境中的部署带来挑战。我们的研究聚焦于通过知识蒸馏开发小 footprint 深度说话人嵌入提取,以应对此局限。尽管该领域先前工作集中于话语级说话人嵌入提取,我们的方法涉及融合来自 x-vector 模型(教师网络)不同层级的嵌入以训练紧凑的学生网络。结果凸显了帧级信息的重要性:根据教师嵌入尺寸的不同,学生模型相较教师模型实现了 85%–91% 的显著尺寸缩减。值得注意的是,通过拼接教师嵌入,我们得到的学生网络在保持与教师相当性能的同时,模型尺寸大幅缩减 75%。这些发现与见解可推广至其他 x-vector 变体,印证了我们方法的广泛适用性。
引用
@article{arxiv.2303.01125,
title = {Distilling Multi-Level X-vector Knowledge for Small-footprint Speaker Verification},
author = {Xuechen Liu and Md Sahidullah and Tomi Kinnunen},
journal= {arXiv preprint arXiv:2303.01125},
year = {2023}
}
备注
Submitted to Data & Knowledge Engineering at Dec. 2023. Copyright may be transferred without notice