中文

利用强化学习推进多模态大语言模型中的语音摘要

音频与语音处理 2025-09-25 v1 人工智能 计算与语言

摘要

语音摘要是口语内容理解的关键组成部分,尤其是在口语和视听数据快速增长的时代。多模态大语言模型(MLLMs)的最新进展,利用了大语言模型(LLMs)的能力,能够直接从语音生成文本摘要,无需中间转录,同时支持可控风格和零样本泛化。然而,开源MLLMs在语音摘要方面仍落后于最先进的基于文本的LLMs,限制了它们的实际部署。在这项工作中,我们提出了一种新颖的多阶段强化学习训练框架,以增强MLLMs的语音摘要能力。我们的模型在强基线上取得了显著改进,优于更大规模的MLLMs,并显著缩小了与最先进的基于文本的LLMs的差距。

关键词

引用

@article{arxiv.2509.19631,
  title  = {Advancing Speech Summarization in Multi-modal LLMs with Reinforcement Learning},
  author = {Shaoshi Ling and Gang Liu and Guoli Ye and Jinyu Li},
  journal= {arXiv preprint arXiv:2509.19631},
  year   = {2025}
}