中文

生成对抗后训练缓解了现场人类- AI 音乐互动中的奖励破坏

机器学习 2026-05-12 v4 声音

摘要

生成式 AI 的大多数应用涉及人输入提示后等待响应的顺序交互,其中反应时间和适应性不重要。在 contrast 中,现场即兴演奏是一种需要实时协调和适应的协作交互,无法访问其他玩家的未来动作,同时要保持多样性以维持创造性流动。强化学习后训练通过基于策略的交互实现有效适应,但常通过利用连贯性奖励降低输出多样性。这种收缩被称为“奖励破坏”,影响许多强化学习后训练管道,尤其在现场即兴演奏中尤为有害,因为音乐创造力依赖于动态变化和相互响应。在本文中,我们提出了一种用于缓解 RL 后训练中奖励破坏的新型对抗训练方法,用于将旋律转化为和弦伴奏。一个 co-evolved 判别器将策略轨迹与数据分布分离,策略除了连贯奖励外还最大化判别器输出,以防止简化输出。我们在固定测试旋律和学习旋律代理两种情况下对伴奏质量和输出多样性进行评估,并在模型部署于实时交互系统中进行用户研究,邀请专家音乐家参与。定量评估和用户反馈显示,输出多样性、和声连贯性、适应速度和用户主动性均得到改善。我们的结果表明,这是一种简单而有效的方法,用于缓解强化学习后训练中生成序列模型的奖励破坏。

关键词

引用

@article{arxiv.2511.17879,
  title  = {Generative Adversarial Post-Training Mitigates Reward Hacking in Live Human-AI Music Interaction},
  author = {Yusong Wu and Stephen Brade and Aleksandra Teng Ma and Tia-Jane Fowler and Enning Yang and Berker Banar and Aaron Courville and Natasha Jaques and Cheng-Zhi Anna Huang},
  journal= {arXiv preprint arXiv:2511.17879},
  year   = {2026}
}

备注

v3: fix the Figure numbering bugs