将文本到音乐模型与语言模型集成:构成长结构音乐作品
声音
2024-10-08 v3 机器学习
音频与语音处理
摘要
最近基于变压器的音乐生成方法的上下文窗口可达到一分钟左右。这些方法生成的音乐在上下文窗口之外往往是无结构的。当拥有更长的上下文窗口时,从音乐数据中学习长尺度结构是一个极具挑战性的问题。本文提出将文本到音乐模型与大语言模型集成,以生成具有形式的音乐。本文讨论了这种集成的挑战解决方案。实验结果表明,所提出的方法能够生成持续 2.5 分钟且高度结构化、组织性强且连贯性好的音乐。
引用
@article{arxiv.2410.00344,
title = {Integrating Text-to-Music Models with Language Models: Composing Long Structured Music Pieces},
author = {Lilac Atassi},
journal= {arXiv preprint arXiv:2410.00344},
year = {2024}
}
备注
arXiv admin note: substantial text overlap with arXiv:2404.11976