面向可唱旋律转歌词生成的措辞与格式联合学习
计算与语言
2025-12-15 v3 声音
音频与语音处理
摘要
尽管旋律转歌词生成取得了进展,机器生成的歌词与人类作词人创作的歌词之间仍存在显著的可唱性差距。在这项工作中,我们旨在通过联合学习旋律转歌词生成的措辞与格式来缩小这一差距。在通用领域预训练之后,我们的模型通过在大型纯文本歌词语料库上训练的自监督阶段获得长度感知能力。在有监督的旋律转歌词训练中,我们引入了多个受音乐学中关于旋律—歌词关系的发现启发的辅助监督目标,鼓励模型捕捉细粒度的韵律与结构模式。与朴素微调相比,我们的方法在行数与音节数要求上的遵循率分别绝对提升了 3.8% 和 21.4%,且不损害文本质量。在人类评估中,相较两个任务专用基线,其整体质量分别取得 42.2% 和 74.2% 的相对提升,凸显了格式感知训练对于生成可唱歌词的重要性。
引用
@article{arxiv.2307.02146,
title = {Joint Learning of Wording and Formatting for Singable Melody-to-Lyric Generation},
author = {Longshen Ou and Xichu Ma and Ye Wang},
journal= {arXiv preprint arXiv:2307.02146},
year = {2025}
}
备注
An extension of our previous work arXiv:2305.16816 [cs.CL]