聆听又选对答案:基于大语言模型的自动语音识别新范式
计算与语言
2024-05-17 v1 人工智能
机器学习
声音
音频与语音处理
摘要
近期大语言模型(LLM)的进展推动了基于生成式纠错(GER)的自动语音识别(ASR),该方法旨在从解码的 N-best 假设中预测ground-truth转录文本。得益于 LLM 的强大语言生成能力以及 N-best 列表中丰富的信息,GER 在增强 ASR 结果方面显示出巨大的有效性。然而,它仍然存在两个局限性:1) LLM 在 GER 时对源语音不敏感,这可能导致结果在语法上正确但违反源语音内容;2) N-best 假设通常仅在少数 token 上有所不同,将它们全部用于 GER 可能是冗余的,这会使 LLM 难以聚焦于应关注的 token,从而导致误纠正。本文提出了一种新的 ASR 生成式纠错范式:ClozeGER。首先,我们引入一种多模态 LLM(即 SpeechGPT)作为额外输入以提高纠错输出的忠实度。然后,我们将 GER 重新格式化为 cloze 测试,并进行 logits 校准,以消除输入信息的冗余并以清晰的指令简化 GER。实验表明,ClozeGER 在 9 个流行的 ASR 数据集上实现了相较于 vanilla GER 的突破性进展。
引用
@article{arxiv.2405.10025,
title = {Listen Again and Choose the Right Answer: A New Paradigm for Automatic Speech Recognition with Large Language Models},
author = {Yuchen Hu and Chen Chen and Chengwei Qin and Qiushi Zhu and Eng Siong Chng and Ruizhe Li},
journal= {arXiv preprint arXiv:2405.10025},
year = {2024}
}
备注
14 pages, Accepted by ACL 2024