中文

DeepRapper:基于押韵与节奏建模的神经说唱生成

声音 2021-07-06 v1 人工智能 计算与语言 机器学习 音频与语音处理

摘要

说唱生成旨在产生歌词及相应的演唱节拍,需要对押韵和节奏进行建模。先前说唱生成的工作聚焦于押韵歌词而忽略了节奏节拍,而后者对说唱表演十分重要。本文中,我们开发了DeepRapper,一个基于Transformer的说唱生成系统,能够同时对押韵和节奏建模。由于尚无带节奏节拍的可用说唱数据集,我们开发了数据挖掘流程以收集大规模说唱数据集,其中包含大量歌词与节奏节拍对齐的说唱歌曲。其次,我们设计了一个基于Transformer的自回归语言模型,仔细地对押韵和节奏建模。具体而言,我们以逆序生成歌词,利用押韵表示与约束增强押韵,并向歌词中插入节拍符号以建模节奏/节拍。据我们所知,DeepRapper是首个生成兼具押韵与节奏的说唱的系统。客观与主观评估均表明DeepRapper生成了富有创意且高质量的带押韵与节奏的说唱。代码将在GitHub上发布。

关键词

引用

@article{arxiv.2107.01875,
  title  = {DeepRapper: Neural Rap Generation with Rhyme and Rhythm Modeling},
  author = {Lanqing Xue and Kaitao Song and Duocai Wu and Xu Tan and Nevin L. Zhang and Tao Qin and Wei-Qiang Zhang and Tie-Yan Liu},
  journal= {arXiv preprint arXiv:2107.01875},
  year   = {2021}
}

备注

Accepted by ACL 2021 main conference