AS-ASR:基于 Whisper-tiny 的轻量级瘫痪专用自动语音识别框架
音频与语音处理
2026-02-03 v2 人工智能
摘要
本文提出了 AS-ASR,这是一个基于 Whisper-tiny 的轻量级瘫痪专用语音识别框架,针对边缘设备的低资源部署而设计。我们的 метод引入了一种混合训练策略,通过以不同比例组合标准语音和瘫痪语音,实现稳健的泛化,并采用基于 GPT-4 的参考增强方法,以细化嘈杂的瘫痪转录文本,提高监督质量。我们在多种数据混合配置和评估设置下进行了大量实验。结果表明,经过微调的模型显著优于零样本基线,使瘫痪语音的词错误率(WER)降低超过 30%,同时保持了标准语音的性能。该框架提供了一个可扩展且高效的解决方案,用于实际场景中的失能语音识别。
引用
@article{arxiv.2506.06566,
title = {AS-ASR: A Lightweight Framework for Aphasia-Specific Automatic Speech Recognition},
author = {Chen Bao and Chuanbing Huo and Qinyu Chen and Chang Gao},
journal= {arXiv preprint arXiv:2506.06566},
year = {2026}
}
备注
Accepted to 2025 IEEE Biomedical Circuits and Systems Conference (BioCAS)