中文

适用于儿童语音识别的轻量化高效 Whisper 适配:面向设备边缘应用

音频与语音处理 2025-07-22 v1 人机交互 声音

摘要

为了支持以儿童为中心的语音交互应用,依赖云服务商进行语音识别推理正变得越来越具挑战,这主要由于监管和隐私问题。以隐私为导向的设计动机驱动本研究,旨在开发一个可在树莓派上运行的轻量化高效 Whisper 语音识别系统。经过评估 MyST 语料库,并考察 various 过滤策略以微调 tiny.en 模型,实现了 15.9% 的词错误率 (WER) (过滤后 11.8%)。低秩压缩将编码器缩小 0.51M 参数,GPU 上推理速度提升 1.26 倍,WER 增加 11%。在 Pi 上推理时,压缩版本少计算约 2 GFLOPS。各种输入音频时长下,两者的实时因子 (RTF) 均在 [0.23-0.41] 范围内。分析了 RAM 使用和 CPU 温度,表明 Pi 能够处理这两个 tiny 模型,但注意到小模型启动时会引入额外的开销/热降频。

关键词

引用

@article{arxiv.2507.14451,
  title  = {Adapting Whisper for Lightweight and Efficient Automatic Speech Recognition of Children for On-device Edge Applications},
  author = {Satwik Dutta and Shruthigna Chandupatla and John Hansen},
  journal= {arXiv preprint arXiv:2507.14451},
  year   = {2025}
}

备注

5 pages, 5 figures, accepted for presentation at the 2025 Workshop on Child Computer Interaction (WOCCI 2025), a Satellite Workshop of the 2025 Interspeech Conference