利用强化学习推进多模态大语言模型中的语音摘要
音频与语音处理
2025-09-25 v1 人工智能
计算与语言
摘要
语音摘要是口语内容理解的关键组成部分,尤其是在口语和视听数据快速增长的时代。多模态大语言模型(MLLMs)的最新进展,利用了大语言模型(LLMs)的能力,能够直接从语音生成文本摘要,无需中间转录,同时支持可控风格和零样本泛化。然而,开源MLLMs在语音摘要方面仍落后于最先进的基于文本的LLMs,限制了它们的实际部署。在这项工作中,我们提出了一种新颖的多阶段强化学习训练框架,以增强MLLMs的语音摘要能力。我们的模型在强基线上取得了显著改进,优于更大规模的MLLMs,并显著缩小了与最先进的基于文本的LLMs的差距。
引用
@article{arxiv.2509.19631,
title = {Advancing Speech Summarization in Multi-modal LLMs with Reinforcement Learning},
author = {Shaoshi Ling and Gang Liu and Guoli Ye and Jinyu Li},
journal= {arXiv preprint arXiv:2509.19631},
year = {2025}
}