中文

提示大语言模型用于语音识别中的零样本领域自适应

计算与语言 2023-06-29 v1 音频与语音处理 信号处理

摘要

语言模型(LMs)的集成已被证明是解决语音识别中领域偏移的有效途径。然而,这些方法通常需要大量目标领域文本数据来训练语言模型。与这些方法不同,本工作中仅借助一个领域特定文本提示,我们提出了两种使用 LLaMA(一个 70 亿参数的大语言模型(LLM))的零样本 ASR 领域自适应方法。LLM 以两种方式使用:1)第二遍重打分:用 LLaMA 对给定 ASR 系统的 N-best 假设重排序;2)深度 LLM 融合:将 LLM 融入基于编码器-解码器的 ASR 系统解码器中。实验表明,仅用一个领域提示,两种方法都能有效降低域外 TedLium-2 与 SPGISpeech 数据集上的词错误率(WER)。特别是,深度 LLM 融合在更好地召回实体词和集外词方面具有优势。

关键词

引用

@article{arxiv.2306.16007,
  title  = {Prompting Large Language Models for Zero-Shot Domain Adaptation in Speech Recognition},
  author = {Yuang Li and Yu Wu and Jinyu Li and Shujie Liu},
  journal= {arXiv preprint arXiv:2306.16007},
  year   = {2023}
}