中文

SongMASS:基于预训练与对齐约束的自动写歌

声音 2020-12-10 v1 计算与语言 音频与语音处理

摘要

自动写歌旨在由机器创作歌曲(歌词和/或旋律),是学术界与工业界均感兴趣的话题。在自动写歌中,歌词到旋律生成与旋律到歌词生成是两个重要任务,二者通常面临以下挑战:1)配对的歌词与旋律数据有限,考虑到歌词与旋律间弱相关性需要大量配对训练数据,这影响了两个任务的生成质量;2)歌词与旋律之间需要严格对齐,这依赖于特定的对齐建模。本文提出 SongMASS 以应对上述挑战,其利用掩码序列到序列(MASS)预训练与基于注意力的对齐建模进行歌词到旋律和旋律到歌词生成。具体而言,1)我们将原始的句子级 MASS 预训练扩展到歌曲级,以更好地捕捉音乐中的长上下文信息,并对每种模态(歌词或旋律)使用独立的编码器和解码器;2)我们在训练时利用句子级注意力掩码与词符级注意力约束来增强歌词与旋律的对齐。推理时,我们使用动态规划策略获得歌词中每个词/音节与旋律中音符的对齐。我们在未配对的歌词和旋律数据集上预训练 SongMASS,客观与主观评测均表明,SongMASS 生成的歌词和旋律质量显著优于无预训练或对齐约束的基线方法。

关键词

引用

@article{arxiv.2012.05168,
  title  = {SongMASS: Automatic Song Writing with Pre-training and Alignment Constraint},
  author = {Zhonghao Sheng and Kaitao Song and Xu Tan and Yi Ren and Wei Ye and Shikun Zhang and Tao Qin},
  journal= {arXiv preprint arXiv:2012.05168},
  year   = {2020}
}