通过多指令训练教会多语言大语言模型理解多语言语音
计算与语言
2024-04-18 v1 声音
音频与语音处理
摘要
语言建模的最新进展导致了能够处理各种自然语言处理任务的大语言模型(LLMs)的出现。尽管在基于文本的任务中取得了成功,但将LLMs应用于语音领域仍然有限且具有挑战性。本文提出了BLOOMZMMS,一种新颖的模型,它将多语言LLM与多语言语音编码器集成,旨在利用LLMs的能力进行语音识别及其他任务。利用多指令训练方法,我们展示了语言知识从文本模态到语音模态的可迁移性。我们在139种语言的1900小时转录数据上进行的实验表明,可以有效地学习多语言语音表示并将其与多语言LLM对齐。虽然这种学习到的表示最初在任务泛化方面存在局限性,但我们通过以多指令风格生成合成目标来解决这个问题。我们的零样本评估结果证实了我们的方法在多个任务(包括语音翻译和多语言口语理解)上的鲁棒性,从而为LLMs在语音领域的应用开辟了新途径。
引用
@article{arxiv.2404.10922,
title = {Teaching a Multilingual Large Language Model to Understand Multilingual Speech via Multi-Instructional Training},
author = {Pavel Denisov and Ngoc Thang Vu},
journal= {arXiv preprint arXiv:2404.10922},
year = {2024}
}
备注
NAACL Findings 2024