中文

AS-ASR:基于 Whisper-tiny 的轻量级瘫痪专用自动语音识别框架

音频与语音处理 2026-02-03 v2 人工智能

摘要

本文提出了 AS-ASR,这是一个基于 Whisper-tiny 的轻量级瘫痪专用语音识别框架,针对边缘设备的低资源部署而设计。我们的 метод引入了一种混合训练策略,通过以不同比例组合标准语音和瘫痪语音,实现稳健的泛化,并采用基于 GPT-4 的参考增强方法,以细化嘈杂的瘫痪转录文本,提高监督质量。我们在多种数据混合配置和评估设置下进行了大量实验。结果表明,经过微调的模型显著优于零样本基线,使瘫痪语音的词错误率(WER)降低超过 30%,同时保持了标准语音的性能。该框架提供了一个可扩展且高效的解决方案,用于实际场景中的失能语音识别。

关键词

引用

@article{arxiv.2506.06566,
  title  = {AS-ASR: A Lightweight Framework for Aphasia-Specific Automatic Speech Recognition},
  author = {Chen Bao and Chuanbing Huo and Qinyu Chen and Chang Gao},
  journal= {arXiv preprint arXiv:2506.06566},
  year   = {2026}
}

备注

Accepted to 2025 IEEE Biomedical Circuits and Systems Conference (BioCAS)