面向端到端语音翻译的大语言模型微调
计算与语言
2023-10-04 v1 计算机视觉与模式识别
摘要
随着大语言模型(LLMs)的出现,基于 LLM 的多模态模型已展现显著潜力。LLaSM、X-LLM 与 SpeechGPT 等模型表现出令人印象深刻的遵循并生成人类指令的能力。然而,在面对端到端语音翻译(E2E-ST)这类跨语言、跨模态翻译任务等复杂任务时,其性能常显不足。相较单模态模型,多模态模型在此类场景中落后。本文提出 LST,一种专为精通 E2E-ST 任务设计的大多模态模型。LST 由语音前端、适配器与 LLM 后端组成。LST 训练含两阶段:(1)模态对齐,调谐适配器使语音表征与文本嵌入空间对齐;(2)下游任务微调,同时训练适配器与 LLM 以优化 E2E-ST 任务性能。MuST-C 语音翻译基准上的实验表明,LST-13B 在 En-De/En-Fr/En-Es 语言对上 BLEU 达 30.39/41.55/35.33,超越以往模型并树立新 SOTA。此外,我们对单模态模型选择及训练策略影响做了深入分析,为未来研究奠基。评审后我们将开源代码与模型。
引用
@article{arxiv.2310.02050,
title = {Tuning Large language model for End-to-end Speech Translation},
author = {Hao Zhang and Nianwen Si and Yaqi Chen and Wenlin Zhang and Xukui Yang and Dan Qu and Xiaolin Jiao},
journal= {arXiv preprint arXiv:2310.02050},
year = {2023}
}