中文

MusicRL:将音乐生成对齐至人类偏好

机器学习 2024-02-07 v1 声音 音频与语音处理

摘要

我们提出了 MusicRL,是首个受人类反馈微调的音乐生成系统。欣赏文本到音乐模型具有高度主观性,因为音乐性概念以及特定标题背后的意图因人而异(例如,标题为“激情的运动音乐”可对应复古吉他独奏或电子流行节拍)。这不仅使得此类模型的监督式训练具有挑战性,也需要在部署后将持续的人类反馈集成到模型微调中。MusicRL 是一个预训练的自回归 MusicLM(Agostinelli 等,2023)模型的离散音频 token 版本,采用强化学习进行微调以最大化序列级奖励。我们借助精选评分者设计了与文本一致性和音频质量相关的奖励函数,并据此对 MusicLM 进行微调得到 MusicRL-R。我们部署 MusicLM 并收集了包含 30 万对偏好数据的大型数据集。通过从人类反馈中进行强化学习(RLHF),我们训练了 MusicRL-U,成为首个规模化集成人类反馈的文本到音乐模型。人类评估表明,MusicRL-R 和 MusicRL-U 均被认为优于基线模型。最终,MusicRL-RU 融合了两种方法,获得最佳模型。消融研究揭示了影响人类偏好的音乐属性,表明文本一致性和质量仅占其中的一部分。这凸显了音乐欣赏的主观性,并呼吁进一步邀请人类听众参与音乐生成模型的微调。

关键词

引用

@article{arxiv.2402.04229,
  title  = {MusicRL: Aligning Music Generation to Human Preferences},
  author = {Geoffrey Cideron and Sertan Girgin and Mauro Verzetti and Damien Vincent and Matej Kastelic and Zalán Borsos and Brian McWilliams and Victor Ungureanu and Olivier Bachem and Olivier Pietquin and Matthieu Geist and Léonard Hussenot and Neil Zeghidour and Andrea Agostinelli},
  journal= {arXiv preprint arXiv:2402.04229},
  year   = {2024}
}