提示大语言模型用于语音识别中的零样本领域自适应
计算与语言
2023-06-29 v1 音频与语音处理
信号处理
摘要
语言模型(LMs)的集成已被证明是解决语音识别中领域偏移的有效途径。然而,这些方法通常需要大量目标领域文本数据来训练语言模型。与这些方法不同,本工作中仅借助一个领域特定文本提示,我们提出了两种使用 LLaMA(一个 70 亿参数的大语言模型(LLM))的零样本 ASR 领域自适应方法。LLM 以两种方式使用:1)第二遍重打分:用 LLaMA 对给定 ASR 系统的 N-best 假设重排序;2)深度 LLM 融合:将 LLM 融入基于编码器-解码器的 ASR 系统解码器中。实验表明,仅用一个领域提示,两种方法都能有效降低域外 TedLium-2 与 SPGISpeech 数据集上的词错误率(WER)。特别是,深度 LLM 融合在更好地召回实体词和集外词方面具有优势。
引用
@article{arxiv.2306.16007,
title = {Prompting Large Language Models for Zero-Shot Domain Adaptation in Speech Recognition},
author = {Yuang Li and Yu Wu and Jinyu Li and Shujie Liu},
journal= {arXiv preprint arXiv:2306.16007},
year = {2023}
}