MeloTrans:遵循人类作曲习惯的文本到符号音乐生成模型
声音
2024-10-18 v1 多媒体
音频与语音处理
摘要
目前,神经网络模型展现出强大的序列预测能力,并被用于许多自动作曲模型中。相比之下,人类作曲的方式与之截然不同。作曲家通常从创作音乐动机开始,然后通过一系列规则将其发展为音乐。这个过程确保了音乐具有特定的结构和变化模式。然而,神经网络模型难以从训练数据中学习这些作曲规则,导致生成的音乐缺乏音乐性和多样性。本文认为,将神经网络的学习能力与人类知识相结合可能会带来更好的结果。为了实现这一点,我们开发了POP909数据集,这是第一个包含音乐动机及其变体标签的数据集,为模仿人类作曲习惯提供了基础。在此基础上,我们提出了MeloTrans,一种采用动机发展规则原理的文本到音乐作曲模型。我们的实验表明,MeloTrans超越了现有的音乐生成模型,甚至超过了像ChatGPT-4这样的大型语言模型(LLM)。这突显了将人类见解与神经网络能力相结合以实现卓越符号音乐生成的重要性。
引用
@article{arxiv.2410.13419,
title = {MeloTrans: A Text to Symbolic Music Generation Model Following Human Composition Habit},
author = {Yutian Wang and Wanyin Yang and Zhenrong Dai and Yilong Zhang and Kun Zhao and Hui Wang},
journal= {arXiv preprint arXiv:2410.13419},
year = {2024}
}