Resonate:通过大型音频语言模型在线反馈强化文本到音频生成
声音
2026-03-13 v1
摘要
强化学习(RL)已成为增强大型语言模型(LLM)和视觉生成模型的有效范式。然而,其在文本到音频(TTA)生成中的应用仍 largely 未被探索。以往的工作通常采用离线方法,如直接偏好优化(DPO),并利用对抗语言音频预训练(CLAP)模型作为奖励函数。在本研究中,我们调查将在线组相对策优化(GRPO)集成到TTA生成中的可能性。我们针对基于流匹配的音频模型调整了该算法,证明在线RL显著优于其离线对手。此外,我们融合了来自大型音频语言模型(LALM)的奖励,这些模型能够提供更贴合人类感知的细粒度评分信号。我们的最终模型\textbf{Resonate}仅使用4.7亿参数,便在TTA-Bench上实现了在音频质量和语义对齐方面的新SOTA。
引用
@article{arxiv.2603.11661,
title = {Resonate: Reinforcing Text-to-Audio Generation via Online Feedback from Large Audio Language Models},
author = {Xiquan Li and Junxi Liu and Wenxi Chen and Haina Zhu and Ziyang Ma and Xie Chen},
journal= {arXiv preprint arXiv:2603.11661},
year = {2026}
}