中文

连接语音编码器与大语言模型用于自动语音识别的综合解决方案

机器学习 2024-06-26 v1

摘要

最近的工作在将语音编码器连接到用于语音识别的大语言模型(LLM)方面显示出有希望的结果。然而,仍然存在一些局限性,包括有限的微调选项、缺乏强制语音-文本对齐的机制,以及特别是在领域不匹配条件下的高插入错误。本文提出了一个全面的解决方案来解决这些问题。我们首先研究更周到的微调方案。接下来,我们提出一种匹配损失来增强模态之间的对齐。最后,我们探索训练和推理方法以减少高插入错误。在Librispeech语料库上的实验结果表明,使用参数高效方法(如LoRA)部分微调编码器和LLM是最具成本效益的方法。此外,匹配损失改善了模态对齐,提升了性能。所提出的训练和推理方法显著减少了插入错误。

关键词

引用

@article{arxiv.2406.17272,
  title  = {A Comprehensive Solution to Connect Speech Encoder and Large Language Model for ASR},
  author = {Van Tung Pham and Yist Lin and Tao Han and Wei Li and Jun Zhang and Lu Lu and Yuxuan Wang},
  journal= {arXiv preprint arXiv:2406.17272},
  year   = {2024}
}