文本到音乐生成模型中的解释差距
声音
2024-07-16 v1 人工智能
音频与语音处理
摘要
大规模文本到音乐生成模型显著提升了音乐创作能力,提供了前所未有的创造自由度。然而,这些模型在与人类音乐家协作方面的能力仍受限。本文提出了一个描述音乐交互过程的框架,包括表达、解释和控制的执行。遵循该框架,我们认为现有文本到音乐模型与音乐家之间的主要差距存在于解释阶段,即模型缺乏对音乐家控制指令的解释能力。我们还提出了两种解决此差距的策略,并呼吁音乐信息检索社区解决解释挑战,以提高人机音乐协作效果。
引用
@article{arxiv.2407.10328,
title = {The Interpretation Gap in Text-to-Music Generation Models},
author = {Yongyi Zang and Yixiao Zhang},
journal= {arXiv preprint arXiv:2407.10328},
year = {2024}
}
备注
Under review