中文

通过多任务行为模仿与语音-文本交错提高语音大语言模型的泛化能力

音频与语音处理 2025-05-27 v1 计算与语言 声音

摘要

大型语言模型(LLM)在跨任务推理方面表现突出,推动了将语音集成到 LLM 中的研究热潮。这些语音 LLM(SLLM)通常使用监督微调来对齐语音与文本-based LLM。然而,缺乏跨广泛任务的标注语音数据限制了对齐效率,导致泛化能力差。为此,我们提出一种新型多任务“行为模仿”方法,结合语音-文本交错,称为 MTBI,仅依赖配对语音和转录文本。通过确保 LLM 解码器生成与配对语音和文本等效的响应,我们实现了更广泛的 SLLM。交错进一步提高了对齐效率。我们引入一个简单的基准来评估不同模型在提示和任务方面的泛化能力。实验结果表明,我们的 MTBI 在提示和任务方面均优于当前 SOTA SLLM,同时所需的监督语音数据更少。

关键词

引用

@article{arxiv.2505.18644,
  title  = {Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving},
  author = {Jingran Xie and Xiang Li and Hui Wang and Yue Yu and Yang Xiang and Xixin Wu and Zhiyong Wu},
  journal= {arXiv preprint arXiv:2505.18644},
  year   = {2025}
}

备注

Accepted by Interspeech 2025