利用语音自监督模型加速推理的微调策略:一项比较研究
音频与语音处理
2023-03-14 v1 机器学习
摘要
自监督学习(SSL)使得低资源环境下自动语音识别(ASR)性能取得了实质性进展。在此背景下,已表明更大的自监督特征提取器对于获得更低的下游 ASR 错误率至关重要。因此,更优的性能可能以更长的推理时间为代价。本文探索在微调过程中可部署的不同方法,以减少 SSL 编码器中所需的计算量,从而实现更快的推理。我们将若干现有技术适配到常见 ASR 设置并对其进行基准测试,展示性能下降与推理时间上的收益。有趣的是,我们发现给定足够的下游数据,对输入序列进行简单的下采样以低性能下降和高计算节省优于其他方法,将计算量减少 61.3% 而词错误率(WER)仅增加 0.81。最后,我们分析了该比较对数据集条件变化的鲁棒性,揭示了对数据集大小的敏感性。
引用
@article{arxiv.2303.06740,
title = {Fine-tuning Strategies for Faster Inference using Speech Self-Supervised Models: A Comparative Study},
author = {Salah Zaiem and Robin Algayres and Titouan Parcollet and Slim Essid and Mirco Ravanelli},
journal= {arXiv preprint arXiv:2303.06740},
year = {2023}
}
备注
Submitted to ICASSP "Self-supervision in Audio, Speech and Beyond" workshop