中文

面向轻量化说话人验证的自适应神经网络量化

音频与语音处理 2024-12-03 v3 声音

摘要

现代说话人验证(SV)系统通常需要昂贵的存储和计算资源,从而阻碍其在移动设备上的部署。本文探索了用于轻量化说话人验证的自适应神经网络量化。首先,我们提出了一种新颖的自适应均匀精度量化方法,使其能够基于 k-means 聚类动态生成针对每个网络层定制的量化质心。通过将其应用于预训练的 SV 系统,我们获得了具有不同比特宽度的系列量化变体。为增强低比特量化模型的性能,进一步引入了混合精度量化算法和多阶段微调(MSFT)策略。与均匀精度量化不同,混合精度方法允许为不同网络层分配不同的比特宽度。确定比特组合后,便采用 MSFT 对网络进行特定顺序的分阶段量化和微调。最后,我们设计了两种不同的二值量化方案,以缓解 1 位量化模型性能下降的问题:静态量化器和自适应量化器。在 VoxCeleb 数据集上进行实验表明,无损 4 位均匀精度量化在 ResNets 和 DF-ResNets 上均可实现,实现约 8 倍的压缩比率。此外,与均匀精度方法相比,混合精度量化不仅在相似模型大小下获得额外的性能提升,还能为任何期望的模型大小灵活生成比特组合。我们的建议 1 位量化方案显著提升了二值化模型的性能。最后,与现有轻量化说话人验证系统进行了全面比较,结果显示我们的方法在各种模型大小范围内均显著优于所有先前方法。

关键词

引用

@article{arxiv.2406.05359,
  title  = {Towards Lightweight Speaker Verification via Adaptive Neural Network Quantization},
  author = {Bei Liu and Haoyu Wang and Yanmin Qian},
  journal= {arXiv preprint arXiv:2406.05359},
  year   = {2024}
}

备注

IEEE/ACM Transactions on Audio, Speech, and Language Processing