中文

为时未晚:将声学信息融入大语言模型以实现自动语音识别

计算与语言 2024-02-09 v1 人工智能 多媒体 声音 音频与语音处理

摘要

近期研究成功表明,大语言模型(LLM)可有效用于自动语音识别(ASR)输出之上的生成式纠错(GER)。具体而言,利用一个 LLM 来实现从 ASR 系统生成的 N-best 假设列表到预测输出转录的直接映射。然而,尽管 GER 很有效,但由于训练 LLM 时未考虑语音信号中可用的声学信息,它引入了额外的数据不确定性。在这项工作中,我们旨在通过一种新颖的后期融合解决方案——不确定性感知动态融合(UADF),在生成预测转录之前注入声学信息,从而克服这一局限性。UADF 是一种在自回归解码过程中实现的多模态融合方法,分两个阶段工作:(i)首先分析并校准词元级 LLM 决策,(ii)然后动态地同化来自声学模态的信息。从各种 ASR 任务中收集的实验证据表明,UADF 在多个方面超越了现有的融合机制。它在显著降低词错误率(WER)的同时,缓解了 LLM 中的数据不确定性问题,并解决了融合过程中仅依赖单一模态导致的泛化能力差的问题。我们还证明 UADF 能无缝适应视听语音识别。

关键词

引用

@article{arxiv.2402.05457,
  title  = {It's Never Too Late: Fusing Acoustic Information into Large Language Models for Automatic Speech Recognition},
  author = {Chen Chen and Ruizhe Li and Yuchen Hu and Sabato Marco Siniscalchi and Pin-Yu Chen and Ensiong Chng and Chao-Han Huck Yang},
  journal= {arXiv preprint arXiv:2402.05457},
  year   = {2024}
}

备注

Accepted to ICLR 2024, 17 pages. This work will be open sourced under MIT license