中文

用于重叠语音分离与识别的混合精度 DNN 量化

声音 2021-11-30 v1 音频与语音处理

摘要

重叠语音的识别迄今仍是一项极具挑战的任务。最先进的多通道语音分离系统正变得日益复杂且成本高昂,难以实际应用。为此,低比特神经网络量化为大幅缩减其模型规模提供了有力方案。然而,当前量化方法基于统一精度,未能考虑不同模型组件对量化误差的性能敏感性差异。本文提出新颖的混合精度 DNN 量化方法,通过对基于 TF 掩蔽的多通道语音分离系统的各 TCN 组件施加局部可变比特宽度。最优局部精度设置利用三种技术自动学习:前两种方法基于量化敏感性度量,分别使用均方误差(MSE)损失函数曲率,或全精度与量化分离模型间测得的 KL 散度;第三种方法基于混合精度神经架构搜索。在 LRS3-TED 语料库模拟重叠语音数据上的实验表明,所提混合精度量化技术在 SI-SNR 与 PESQ 分数以及词错误率(WER)降低(绝对最高达 2.88%,相对 8%)方面,始终优于同等比特宽度的统一精度基线语音分离系统。

关键词

引用

@article{arxiv.2111.14479,
  title  = {Mixed Precision DNN Qunatization for Overlapped Speech Separation and Recognition},
  author = {Junhao Xu and Jianwei Yu and Xunying Liu and Helen Meng},
  journal= {arXiv preprint arXiv:2111.14479},
  year   = {2021}
}