面向可生成音乐 AI 的人类偏好对齐:方法与挑战
声音
2025-11-20 v1 人工智能
音频与语音处理
摘要
尽管生成式 AI for music 最近取得了显著进展,实现了卓越的保真度和风格多样性,但这些系统往往无法与细腻的人类偏好保持一致 due to 所使用的特定损失函数。本文主张系统性地将偏好对齐技术应用于音乐生成,解决计算优化与人类音乐欣赏之间的根本性差距。drawing on 最近的突破,包括 MusicRL 的大规模偏好学习、类似扩散偏好优化的 DiffRhythm+ 的多偏好对齐框架,以及 Text2midi-InferAlign 的推理时优化技术,我们讨论了这些技术如何解决音乐的独特挑战:时序一致性、和声一致性和主观质量评估。我们确定了关键研究挑战,包括对长篇作品的可扩展性、可靠性等偏好建模中的问题。展望未来,我们设想偏好对齐的音乐生成将实现变革性的应用,包括交互式作曲工具和个性化音乐服务。该工作呼吁持续的跨学科研究,将机器学习、音乐理论等进步结合起来,创建真正服务于人类创造和体验需求的音乐 AI 系统。
引用
@article{arxiv.2511.15038,
title = {Aligning Generative Music AI with Human Preferences: Methods and Challenges},
author = {Dorien Herremans and Abhinaba Roy},
journal= {arXiv preprint arXiv:2511.15038},
year = {2025}
}
备注
Accepted at the AAAI-2026 Senior Member Track