无监督旋律到歌词生成
计算与语言
2023-12-25 v2 人工智能
声音
音频与语音处理
摘要
自动旋律到歌词生成是一项为给定旋律生成配套歌词的任务。它具有显著的实际意义,且比无约束歌词生成更具挑战性,因为音乐对歌词施加了额外约束。由于大多数歌曲受版权保护,训练数据有限,导致模型对旋律与歌词间复杂的跨模态关系欠拟合。本工作中,我们提出一种无需在任何对齐的旋律-歌词数据上训练即可生成高质量歌词的方法。具体而言,我们设计了一个分层歌词生成框架,先生成歌曲大纲,再生成完整歌词。该框架将训练(纯基于文本)与推理(旋律引导的文本生成)解耦,以规避平行数据的短缺。我们利用旋律与歌词之间的分段和节奏对齐,将给定旋律编译为解码约束以在推理时提供指导。这种两步分层设计还支持通过歌词大纲进行内容控制,这是使协同歌曲创作民主化的备受期待的特性。实验结果表明,我们的模型能生成比强基线(例如 SongMASS,一个在平行数据集上训练的 SOTA 模型)更切题、可唱、易懂且连贯的高质量歌词,基于人类评分有 24% 的相对整体质量提升。
引用
@article{arxiv.2305.19228,
title = {Unsupervised Melody-to-Lyric Generation},
author = {Yufei Tian and Anjali Narayan-Chen and Shereen Oraby and Alessandra Cervone and Gunnar Sigurdsson and Chenyang Tao and Wenbo Zhao and Yiwen Chen and Tagyoung Chung and Jing Huang and Nanyun Peng},
journal= {arXiv preprint arXiv:2305.19228},
year = {2023}
}
备注
ACL 2023. arXiv admin note: substantial text overlap with arXiv:2305.07760