中文

利用 LLM 生成的上下文描述改进领域特定语音识别

计算与语言 2024-07-26 v1 人工智能

摘要

端到端语音识别(E2E ASR)系统通过在大规模数据集上训练显著提升了语音识别效果。尽管已有这些进步,但仍难以准确识别领域特定词汇,如专有名词和技术术语。为解决此问题,本文提出一种方法,利用最新进展的 Whisper 模型,无需修改其架构,既保留其泛化性能,又能有效利用描述。此外,本文提出两种额外的训练技术以提高领域特定语音识别:解码器微调和上下文扰动。我们还提出一种方法,当描述不可得时,使用大语言模型(LLM)生成简单的元数据描述。我们的实验表明,所提方法显著提升了在真实数据集上的领域特定语音识别准确率,LLM 生成的描述在效果上甚至优于人工编写的描述。

关键词

引用

@article{arxiv.2407.17874,
  title  = {Improving Domain-Specific ASR with LLM-Generated Contextual Descriptions},
  author = {Jiwon Suh and Injae Na and Woohwan Jung},
  journal= {arXiv preprint arXiv:2407.17874},
  year   = {2024}
}

备注

Accepted to INTERSPEECH 2024