SALM:具有上下文学习能力的语音增强语言模型用于语音识别与翻译
计算与语言
2023-10-17 v1 人机交互
声音
音频与语音处理
摘要
我们提出了一种具有多任务和上下文学习能力的新型语音增强语言模型(SALM)。SALM 由一个冻结的文本 LLM、一个音频编码器、一个模态适配器模块以及 LoRA 层组成,以适应语音输入和相关的任务指令。统一的 SALM 不仅在自动语音识别(ASR)和语音翻译(AST)上取得了与特定任务 Conformer 基线相当的性能,还展现出零样本上下文学习能力,并通过 ASR 和 AST 的关键词增强任务加以证明。此外,我们提出了语音监督上下文训练,以弥合 LLM 训练与下游语音任务之间的差距,这进一步提升了语音到文本模型的上下文学习能力。所提出的模型已通过 NeMo 工具包开源。
引用
@article{arxiv.2310.09424,
title = {SALM: Speech-augmented Language Model with In-context Learning for Speech Recognition and Translation},
author = {Zhehuai Chen and He Huang and Andrei Andrusenko and Oleksii Hrinchuk and Krishna C. Puvvada and Jason Li and Subhankar Ghosh and Jagadeesh Balam and Boris Ginsburg},
journal= {arXiv preprint arXiv:2310.09424},
year = {2023}
}
备注
submit to ICASSP 2024