SongGLM:基于2D对齐编码和多任务预训练的 lyric-to-melody 生成
音频与语音处理
2024-12-25 v1 人工智能
声音
摘要
lyric-to-melody 生成旨在根据给定的歌词自动创建旋律,需要捕捉歌词与旋律之间的复杂且细微的相关性。然而,前人的工作通常面临两个主要挑战:1)歌词-旋律对齐建模,常被简化为一个音节/单词到一个音符的对齐,而其他人则存在对齐精度低的问题;2)歌词-旋律和声建模,通常严重依赖中间过程或严格规则,限制了模型的能力和生成多样性。本文提出了SongGLM,一种基于广义语言模型(GLM)的 lyric-to-melody 生成系统,利用2D对齐编码和多任务预训练来保证歌词与旋律之间的对齐和和声。具体而言,1)我们引入了用于歌词和旋律的统一符号表示,包含单词级和短语级(2D)对齐编码以捕捉歌词-旋律对齐;2)我们设计了一个多任务预训练框架,包含层次化空白填充目标(n-gram、短语和长跨度),并将歌词-旋律关系纳入和声n-gram提取,以确保歌词-旋律和声。我们还构建了一个大型歌词-旋律配对数据集,包含超过20万个英文歌曲,用于预训练和微调。目标和主观结果表明,SongGLM能够显著提升歌词到旋律的对齐和和声,超过所有以前的基线方法。
引用
@article{arxiv.2412.18107,
title = {SongGLM: Lyric-to-Melody Generation with 2D Alignment Encoding and Multi-Task Pre-Training},
author = {Jiaxing Yu and Xinda Wu and Yunfei Xu and Tieyao Zhang and Songruoyao Wu and Le Ma and Kejun Zhang},
journal= {arXiv preprint arXiv:2412.18107},
year = {2024}
}
备注
Extended version of paper accepted to AAAI 2025