DeepRapper:基于押韵与节奏建模的神经说唱生成
声音
2021-07-06 v1 人工智能
计算与语言
机器学习
音频与语音处理
摘要
说唱生成旨在产生歌词及相应的演唱节拍,需要对押韵和节奏进行建模。先前说唱生成的工作聚焦于押韵歌词而忽略了节奏节拍,而后者对说唱表演十分重要。本文中,我们开发了DeepRapper,一个基于Transformer的说唱生成系统,能够同时对押韵和节奏建模。由于尚无带节奏节拍的可用说唱数据集,我们开发了数据挖掘流程以收集大规模说唱数据集,其中包含大量歌词与节奏节拍对齐的说唱歌曲。其次,我们设计了一个基于Transformer的自回归语言模型,仔细地对押韵和节奏建模。具体而言,我们以逆序生成歌词,利用押韵表示与约束增强押韵,并向歌词中插入节拍符号以建模节奏/节拍。据我们所知,DeepRapper是首个生成兼具押韵与节奏的说唱的系统。客观与主观评估均表明DeepRapper生成了富有创意且高质量的带押韵与节奏的说唱。代码将在GitHub上发布。
引用
@article{arxiv.2107.01875,
title = {DeepRapper: Neural Rap Generation with Rhyme and Rhythm Modeling},
author = {Lanqing Xue and Kaitao Song and Duocai Wu and Xu Tan and Nevin L. Zhang and Tao Qin and Wei-Qiang Zhang and Tie-Yan Liu},
journal= {arXiv preprint arXiv:2107.01875},
year = {2021}
}
备注
Accepted by ACL 2021 main conference