基于GRPO的Speech-Aware大语言模型语音理解能力提升
计算与语言
2025-09-23 v1 人工智能
机器学习
声音
音频与语音处理
摘要
本文引入基于Group Relative Policy Optimization(GRPO)的方法,用于训练Speech-Aware大语言模型(SALLM)以适应开放格式的语音理解任务,如口语问答和自动语音翻译。SALLM在语音理解任务方面已证明效果显著。GRPO因其在训练LLM方面的效率优势而近期受到关注, prior work已探索将其应用于SALLM,主要聚焦于多选题任务。基于此,我们关注更能体现模型生成能力的开放格式任务。我们的做法利用GRPO以BLEU作为奖励信号优化SALLM,实证表明其在多个关键指标上超越标准SFT。最后,我们探索在GRPO中引入离策略样本的潜力,为后续改进和进一步研究指明了方向。
引用
@article{arxiv.2509.16990,
title = {Advancing Speech Understanding in Speech-Aware Language Models with GRPO},
author = {Avishai Elmakies and Hagai Aronowitz and Nimrod Shabtay and Eli Schwartz and Ron Hoory and Avihu Dekel},
journal= {arXiv preprint arXiv:2509.16990},
year = {2025}
}