中文

基于GRPO的Speech-Aware大语言模型语音理解能力提升

计算与语言 2025-09-23 v1 人工智能 机器学习 声音 音频与语音处理

摘要

本文引入基于Group Relative Policy Optimization(GRPO)的方法,用于训练Speech-Aware大语言模型(SALLM)以适应开放格式的语音理解任务,如口语问答和自动语音翻译。SALLM在语音理解任务方面已证明效果显著。GRPO因其在训练LLM方面的效率优势而近期受到关注, prior work已探索将其应用于SALLM,主要聚焦于多选题任务。基于此,我们关注更能体现模型生成能力的开放格式任务。我们的做法利用GRPO以BLEU作为奖励信号优化SALLM,实证表明其在多个关键指标上超越标准SFT。最后,我们探索在GRPO中引入离策略样本的潜力,为后续改进和进一步研究指明了方向。

关键词

引用

@article{arxiv.2509.16990,
  title  = {Advancing Speech Understanding in Speech-Aware Language Models with GRPO},
  author = {Avishai Elmakies and Hagai Aronowitz and Nimrod Shabtay and Eli Schwartz and Ron Hoory and Avihu Dekel},
  journal= {arXiv preprint arXiv:2509.16990},
  year   = {2025}
}