基于在线强化学习的Flow Matching语音增强:FlowSE-GRPO
音频与语音处理
2026-01-26 v1
摘要
生成式语音增强作为传统判别方法的有前景替代方案,通过建模给定噪声输入下干净语音的分布来实现。后训练对齐通过强化学习(RL)可有效地将生成模型与人类偏好和下游指标对齐,在自然语言处理等领域已取得成功,但在语音增强中的应用仍有限,尤其是针对在线RL。先前工作探索了离线方法,如直接偏好优化(DPO);在线方法如GRPO在很大程度上尚未受到调查。本文首次成功将在线GRPO集成到 flow-matching 语音增强框架中,实现了对感知和任务导向指标的高效后训练对齐,仅需少量更新步骤。不同于在大型语言模型上的先前GRPO工作,我们将算法适应语音的连续时序特性以及 flow-matching 生成模型的动态特性。我们表明,优化单个奖励可实现快速指标提升,但常导致奖励作弊,尽管得分更高,却降低了音频保真度。为缓解这一问题,我们提出了多指标奖励优化策略,在平衡竞争目标方面显著减少过拟合,提高整体性能。我们的实验验证了在线GRPO用于语音增强,并为RL基于后训练的生成音频模型提供了实用指导。
引用
@article{arxiv.2601.16483,
title = {FlowSE-GRPO: Training Flow Matching Speech Enhancement via Online Reinforcement Learning},
author = {Haoxu Wang and Biao Tian and Yiheng Jiang and Zexu Pan and Shengkui Zhao and Bin Ma and Daren Chen and Xiangang Li},
journal= {arXiv preprint arXiv:2601.16483},
year = {2026}
}
备注
Accepted by ICASSP 2026