中文

可控的歌词到旋律生成

声音 2023-06-06 v1 人工智能 音频与语音处理

摘要

歌词到旋律生成是 AI 音乐研究领域一个有趣且具挑战性的课题。由于学习歌词与旋律之间相关性的困难,以往方法存在生成质量低且缺乏可控性的问题。生成模型的可控性使人能与模型交互以生成期望内容,这在面向以人为中心、可辅助音乐家创作活动的音乐生成任务中尤为重要。为解决这些问题,我们提出一个可控歌词到旋律生成网络 ConL2M,能够根据用户期望的音乐风格从歌词生成逼真的旋律。我们的工作包含三项主要创新:1) 为建模跨多个序列的音乐属性依赖关系,提出分支间记忆融合(Memofu)以在多分支堆叠 LSTM 架构间实现信息流动;2) 提出参考风格嵌入(RSE)以提升生成质量并控制生成旋律的音乐风格;3) 提出序列级统计损失(SeqLoss)以帮助模型学习给定歌词下旋律的序列级特征。经音乐质量与可控性评估指标验证,可控歌词到旋律生成的初步研究表明,在给定歌词时,其具有更好的生成质量,且能与用户交互生成期望音乐风格的旋律。

关键词

引用

@article{arxiv.2306.02613,
  title  = {Controllable Lyrics-to-Melody Generation},
  author = {Zhe Zhang and Yi Yu and Atsuhiro Takasu},
  journal= {arXiv preprint arXiv:2306.02613},
  year   = {2023}
}