MusicLM:从文本生成音乐
声音
2023-01-27 v1 机器学习
音频与语音处理
摘要
我们介绍 MusicLM,一种根据文本描述(如“由失真吉他重复段衬托的舒缓小提琴旋律”)生成高保真音乐的模型。MusicLM 将条件音乐生成过程视为分层序列到序列建模任务,并生成在数分钟内保持连贯的 24 kHz 音乐。我们的实验表明,MusicLM 在音频质量与文本描述契合度上均优于既往系统。此外,我们展示 MusicLM 可以基于文本与旋律进行条件控制,即能依据文本标题所描述的风格对吹口哨与哼唱的旋律进行转换。为支持未来研究,我们公开发布 MusicCaps,一个由 5.5k 音乐-文本对组成、含人类专家提供丰富文本描述的数据集。
引用
@article{arxiv.2301.11325,
title = {MusicLM: Generating Music From Text},
author = {Andrea Agostinelli and Timo I. Denk and Zalán Borsos and Jesse Engel and Mauro Verzetti and Antoine Caillon and Qingqing Huang and Aren Jansen and Adam Roberts and Marco Tagliasacchi and Matt Sharifi and Neil Zeghidour and Christian Frank},
journal= {arXiv preprint arXiv:2301.11325},
year = {2023}
}
备注
Supplementary material at https://google-research.github.io/seanet/musiclm/examples and https://kaggle.com/datasets/googleai/musiccaps