中文

边缘端的 Wav2Vec2.0:性能评估

声音 2022-02-15 v1 人机交互 音频与语音处理

摘要

Wav2Vec2.0 是一种最先进的模型,它通过未标注的语音数据(即自监督学习)学习语音表示。随后该预训练模型在少量标注数据上微调,以用于语音转文本和机器翻译任务。Wav2Vec2.0 是低资源语言的变革性解决方案,因为它主要使用未标注的音频数据开发。获取大量标注数据是资源密集型的,对于斯瓦希里语、塔塔尔语等低资源语言尤其具有挑战性。此外,Wav2Vec2.0 的词错率(WER)在使用少 100 倍的标注数据情况下,达到或超越了最近的监督学习算法。鉴于其在全球 7000 种语言的语音任务中具有重要性和巨大潜力,评估该模型在低资源、低功耗边缘设备上的准确率、延迟和效率,并研究在此类设备上用于私密、安全和可靠语音任务的可行性至关重要。设备端语音任务避免将音频数据发送至服务器,因此天然提供隐私性、降低的延迟和增强的可靠性。本文在树莓派(Raspberry Pi)上结合 KenLM 语言模型对 Wav2Vec2.0 模型进行了语音识别任务的准确率和延迟评估。文中讨论了如何调优特定参数,以在满足产品的 CPU、内存和能耗预算的同时,达到所需的 WER 率和延迟水平。

关键词

引用

@article{arxiv.2202.05993,
  title  = {Wav2Vec2.0 on the Edge: Performance Evaluation},
  author = {Santosh Gondi},
  journal= {arXiv preprint arXiv:2202.05993},
  year   = {2022}
}

备注

9 pages