中文

基于低比特量化的高效语音表征学习

音频与语音处理 2023-01-03 v1 计算与语言

摘要

随着机器学习硬件的发展,较新的模型往往以规模和计算复杂度的增加为代价。为提高这些模型的效率,我们应用并研究了近期量化技术在语音表征学习模型上的效果。量化技术在 SUPERB 基准上进行了评估。在 ASR 任务上,通过激进量化至 1 比特,我们实现了 86.32% 的存储缩减(184.42 -> 25.23)、88% 的估计运行时间缩减(1.00 -> 0.12),但词错误率上升(7.06 -> 15.96)。与同样旨在模型压缩的 DistillHuBERT 相比,2 比特配置产生了略小的存储(35.84 对比 46.98)、更好的词错误率(12.68 对比 13.37)以及更高效的估计运行时间(0.15 对比 0.73)。

关键词

引用

@article{arxiv.2301.00652,
  title  = {Efficient Speech Representation Learning with Low-Bit Quantization},
  author = {Ching-Feng Yeh and Wei-Ning Hsu and Paden Tomasello and Abdelrahman Mohamed},
  journal= {arXiv preprint arXiv:2301.00652},
  year   = {2023}
}

备注

7 pages