中文

利用LLM修订与语音-语义上下文提升课堂语音中命名实体的语音识别

计算与语言 2026-04-21 v2 人工智能

摘要

课堂演讲和讲座通常包含命名实体(NE),如人名和专门术语。虽然自动语音识别(ASR)系统在通用语音上已取得显著成就,但最先进的 ASR 对命名实体的词错误率(WER)仍然很高。由于 NE 往往是最关键的关键词,误识别它们可能会影响所有下游应用,尤其是当 ASR 作为复杂系统的前端时。在本文中,我们引入了一个大型语言模型(LLM)修订流水线,通过利用 LLM 的世界知识和推理能力以及可用的语音和语义上下文来修订 ASR 预测中的错误 NE。我们还引入了 NER-MIT-OpenCourseWare 数据集,包含来自 MIT 课程的 45 小时数据用于开发和测试。在该数据集上,我们提出的技术对 NE 实现了高达 30% 的相对 WER 降低。

关键词

引用

@article{arxiv.2506.10779,
  title  = {Improving Speech Recognition of Named Entities in Classroom Speech with LLM Revision and Phonetic-Semantic Context},
  author = {Viet Anh Trinh and Xinlu He and Jacob Whitehill},
  journal= {arXiv preprint arXiv:2506.10779},
  year   = {2026}
}