SegTune:面向歌曲生成的结构化与细粒度控制
声音
2026-05-29 v2
摘要
近期的歌曲生成技术取得了显著进展,表现出在从歌词和/或全局文本提示生成歌曲方面的潜力。然而,大多数现有系统缺乏对歌曲中随时间变化属性的建模,限制了对音乐结构和动态性的细粒度控制。在本文中,我们提出SegTune,一个用于结构化和可控歌曲生成的非自回归框架。SegTune通过允许用户或大型语言模型指定与歌曲部分对齐的局部音乐描述,实现段落级别的控制。段落提示通过在相应时间窗口内进行时序广播注入模型,而全局提示则影响整首歌曲,以确保风格一致性。为获得准确的段落时长并实现精确的歌词到音乐的对齐,我们引入了一个基于大型语言模型的时长预测器,用于以LRC格式自回归生成带时间戳的句子级歌词。我们进一步构建了一个大规模数据管道,用于收集带对齐歌词和提示的高质量歌曲,并提出了新的评估指标来评估段落级别的对齐和人声属性一致性。实验结果表明,SegTune在可控性和音乐连贯性方面优于现有基线方法。详见 https://cai525.github.io/SegTune_demo 查看我们的作品演示。
引用
@article{arxiv.2510.18416,
title = {SegTune: Structured and Fine-Grained Control for Song Generation},
author = {Pengfei Cai and Joanna Wang and Haorui Zheng and Xu Li and Zihao Ji and Teng Ma and Zhongliang Liu and Chen Zhang and Pengfei Wan},
journal= {arXiv preprint arXiv:2510.18416},
year = {2026}
}
备注
This technical report was later revised and published at ACL 2026 (oral). ACL paper link: https://openreview.net/forum?id=FKf2S4u8at , code: https://github.com/KlingAIResearch/SegTune