SongCreator:基于歌词的通用歌曲生成
声音
2024-11-01 v2 人工智能
音频与语音处理
摘要
音乐是人类文化中不可或缺的一部分,体现了人类智慧和创造力,其中歌曲构成其中的重要部分。虽然前人的工作探索了歌曲生成的诸多方面,如演唱声、人声构成和乐器编排等,但就给定歌词生成包含人声和伴奏的歌曲而言,仍是一个显著的挑战,限制了音乐生成模型在实际中的应用。针对这一挑战,我们提出了SongCreator——一个设计用于解决这一问题的歌曲生成系统。该模型具有两个新颖设计:一个精心设计的双序列语言模型(DSLM),用于捕获歌曲生成中人声和伴奏的信息;以及一系列注意力掩码策略,用于DSLM,使我们的模型能够理解、生成和编辑歌曲,能够通过使用特定的注意力掩码适用于各种歌曲相关生成任务。广泛的实验表明,SongCreator通过在所有八个任务上实现最先进或有竞争力的性能,证明了其有效性。值得注意的是,在从歌词到歌曲和从歌词到人声方面,SongCreator比以前的工作取得了大幅提升。此外,它能够通过不同的音频提示独立控制生成歌曲中人声和伴奏的声学条件,展现出其潜在的应用价值。我们的样本可在https://thuhcsi.github.io/SongCreator/上访问。
引用
@article{arxiv.2409.06029,
title = {SongCreator: Lyrics-based Universal Song Generation},
author = {Shun Lei and Yixuan Zhou and Boshi Tang and Max W. Y. Lam and Feng Liu and Hangyu Liu and Jingcheng Wu and Shiyin Kang and Zhiyong Wu and Helen Meng},
journal= {arXiv preprint arXiv:2409.06029},
year = {2024}
}
备注
Accepted by NeurIPS 2024