中文

用户引导训练提升AI生成音乐的效果

声音 2025-06-06 v1 人机交互 机器学习 音频与语音处理

摘要

AI音乐生成技术取得了快速进展,扩散模型和自回归算法等技术使得高保真输出成为可能。这些工具可以改变音乐风格、混合乐器或对其进行分离。由于声音可以可视化为频谱图,图像生成算法可用于生成新音乐。然而,这些算法通常在固定数据集上进行训练,导致它们难以准确解释和响应用户输入。这尤其 problematic,因为音乐高度主观,需要提供一种程度的人身化,而图像生成不提供这种人身化。在本工作中,我们提出了一种人机协同方法,依据用户交互逐步改善这些算法的性能。人机协同环节涉及聚合和筛选用户评级,用作微调模型的损失函数。我们采用遗传算法,将用户反馈纳入其中,以增强最初在固定数据集上训练的模型的基线性能。通过每次迭代中用户评级的平均提升幅度来衡量该方法的有效性。在试点测试中,第一轮迭代显示出与基线相比的平均评级提升0.2分。第二轮迭代进一步超越了这一水平,实现了相对于第一轮迭代的额外提升0.39分。

关键词

引用

@article{arxiv.2506.04852,
  title  = {Improving AI-generated music with user-guided training},
  author = {Vishwa Mohan Singh and Sai Anirudh Aryasomayajula and Ahan Chatterjee and Beste Aydemir and Rifat Mehreen Amin},
  journal= {arXiv preprint arXiv:2506.04852},
  year   = {2025}
}

备注

Select for presentation in HHAI 2025