中文

基于语音检索增强的 ASR 上下文化与大语言模型

音频与语音处理 2024-09-25 v1 计算与语言 机器学习 声音

摘要

大语言模型 (LLM) 已展现出对多模态信号(包括音频和文本)的卓越建模能力,使其能够在语音输入的基础上生成口语或文本响应。然而,在输入模态为语音时,识别个人专有实体(如电话簿中的联系人)仍是一个挑战。本文我们从语音识别任务出发,提出一种基于检索的解决方案来实现 LLM 的上下文化:首先让 LLM 在无上下文的情况下检测语音中的专有实体,然后将该专有实体作为查询,从个人数据库中检索出语音相似的专有实体并输入 LLM,最后进行上下文感知的 LLM 解码。在一个语音助手任务中,我们的解决方案相对于没有上下文化的基线系统,在语音识别错误率上实现了最高可达 30.2% 的相对降低,在专有实体识别错误率上实现了 73.6% 的相对降低。值得注意的是,我们的解决方案通过设计避免了向 LLM 提示完整的专有实体数据库,使其在大规模专有实体数据库中具有高度效率和适用性。

关键词

引用

@article{arxiv.2409.15353,
  title  = {Contextualization of ASR with LLM using phonetic retrieval-based augmentation},
  author = {Zhihong Lei and Xingyu Na and Mingbin Xu and Ernest Pusateri and Christophe Van Gysel and Yuanyuan Zhang and Shiyi Han and Zhen Huang},
  journal= {arXiv preprint arXiv:2409.15353},
  year   = {2024}
}