中文

SW-ASR:面向鲁棒单词语音识别的上下文感知混合 ASR 流水线

声音 2026-01-30 v1 计算与语言 音频与语音处理

摘要

单词自动语音识别 (ASR) 因缺乏语言上下文以及对噪声、发音变化和信道破坏的敏感性而具有挑战性,尤其是在诸如医疗和紧急响应等沟通关键且资源有限的领域。本文综述了近期的深度学习方法,并提出了一种模块化框架,用于鲁棒的单词检测。该系统将去噪和规范化与混合 ASR 前端 (Whisper + Vosk) 以及一个设计用于处理词汇表外单词和降级音频的验证层相结合。验证层支持多种匹配策略,包括嵌入相似性、编辑距离和可选上下文指导的 LLM 基于匹配。我们在 Google Speech Commands 数据集和来自电话和信息平台的精选真实世界数据集上进行评估,该数据集在带宽受限条件下进行。结果表明,尽管混合 ASR 前端在干净音频上表现良好,但验证层在噪声和压缩信道上显著提高了准确率。以上下文引导和 LLM 基于匹配为主的匹配方式获得了最大的提升,表明轻量级验证和上下文机制可以在不牺牲实时电话应用所需延迟的情况下,大大提高了单词 ASR 的鲁棒性。

关键词

引用

@article{arxiv.2601.20890,
  title  = {SW-ASR: A Context-Aware Hybrid ASR Pipeline for Robust Single Word Speech Recognition},
  author = {Manali Sharma and Riya Naik and Buvaneshwari G},
  journal= {arXiv preprint arXiv:2601.20890},
  year   = {2026}
}