面向无幻觉歌曲生成的强化学习偏好优化框架
声音
2025-08-08 v1 人工智能
音频与语音处理
摘要
近期音频生成式语言模型的进展加速了 AI 驱动的抒情诗到歌曲生成。然而,这些模型常常因内容幻觉而出现问题,即生成的输出与输入抒情诗不一致,破坏了音乐的连贯性。当前的监督微调(SFT)方法由于依赖被动标签匹配,缺乏自我提升能力,幻觉抑制效果差。为解决这一核心挑战,我们提出一种基于偏好优化的强化学习(RL)框架,用于控制幻觉。我们的主要贡献包括:(1)开发稳健的幻觉偏好数据集,通过计算音素错误率(PER)和基于规则的过滤,捕捉与人类期望的一致性;(2)在 RL 框架中实现并评估三种不同的偏好优化策略:直接偏好优化(DPO)、近端策略优化(PPO)和群相对策略优化(GRPO)。DPO 采用离策略方法,通过增强正向 token 的概率,实现了约 7.4% 的 PER 降低。PPO 和 GRPO 采用在策略方法,训练基于 PER 的奖励模型,通过奖励最大化和 KL 正则化迭代优化序列,分别实现了 4.9% 和 4.7% 的 PER 降低。全面的客观和主观评估确认,我们的方法有效抑制了幻觉,同时保持了音乐质量。关键是,这项工作为抒情诗到歌曲生成中的幻觉控制提供了一个系统的方法性 RL 解决方案。该框架的可迁移性还 unlocks 了音乐风格遵循和音乐性提升的潜力,为未来的生成歌曲研究开辟了新的方向。
引用
@article{arxiv.2508.05011,
title = {Towards Hallucination-Free Music: A Reinforcement Learning Preference Optimization Framework for Reliable Song Generation},
author = {Huaicheng Zhang and Wei Tan and Guangzheng Li and Yixuan Zhang and Hangting Chen and Shun Lei and Chenyu Yang and Zhiyong Wu and Shuai Wang and Qijun Huang and Dong Yu},
journal= {arXiv preprint arXiv:2508.05011},
year = {2025}
}