Amuse:面向人类-人工智能协作的多模态创作歌曲
人机交互
2025-02-17 v2
摘要
歌曲创作往往受到多模态灵感的驱动,如意象、叙事或既有音乐,但当前音乐人工智能系统在将这些多模态输入纳入创作过程中缺乏支持。我们介绍 Amuse,这是一个歌曲创作助手,可将多模态(图像、文本或音频)输入转化为可无缝融入歌曲创作过程的和弦进行。Amuse 的一个关键特点是其新颖的方法,用于在缺乏多模态输入与和弦配对示例数据集的情况下生成与音乐关键词相关且连贯的和弦。具体而言,我们提出的方法利用多模态大型语言模型(LLM)将多模态输入转化为带噪声的和弦建议,并使用单模态和弦模型对这些建议进行筛选。针对歌曲作曲家的用户研究表明,Amuse 有效地支持了将多模态想法转化为连贯的音乐建议,增强了用户在整个歌曲创作过程中掌控感和创造力。
引用
@article{arxiv.2412.18940,
title = {Amuse: Human-AI Collaborative Songwriting with Multimodal Inspirations},
author = {Yewon Kim and Sung-Ju Lee and Chris Donahue},
journal= {arXiv preprint arXiv:2412.18940},
year = {2025}
}
备注
Published as a conference paper at CHI 2025. Project page: https://yewon-kim.com/amuse