让我们逐步融合:一种基于LLM的生成式融合解码算法,用于鲁棒且指令感知的ASR和OCR
计算与语言
2025-06-12 v4 人工智能
摘要
我们提出了“生成式融合解码”(GFD),一种新颖的浅融合框架,旨在将大型语言模型(LLM)集成到跨模态文本识别系统中,用于自动语音识别(ASR)和光学字符识别(OCR)。我们推导了必要的公式,使GFD能够通过计算字节级别的似然度来操作不同模型的不匹配词元空间,从而在解码过程中实现无缝融合和同步推进。GFD设计为即插即用,使其能够轻松兼容各种自回归模型,无需任何重新训练。通过与LLM的中间频繁交互,GFD在通用ASR和OCR任务上被证明是有效的,在英语和中文基准测试中超越了级联方法。此外,GFD传递了LLM的上下文学习能力,并允许在指令感知和长上下文设置中进行自适应ASR,实现了高达17.7%的词错误率(WER)降低。
引用
@article{arxiv.2405.14259,
title = {Let's Fuse Step by Step: A Generative Fusion Decoding Algorithm with LLMs for Robust and Instruction-Aware ASR and OCR},
author = {Chan-Jan Hsu and Yi-Chang Chen and Feng-Ting Liao and Pei-Chen Ho and Yu-Hsiang Wang and Po-Chun Hsu and Da-shan Shiu},
journal= {arXiv preprint arXiv:2405.14259},
year = {2025}
}