MeloDISinger:基于音频填充的旋律感知与时长保持歌声编辑模型
音频与语音处理
2026-06-29 v1 声音
摘要
基于文本的歌声编辑(SVE)旨在修改演唱歌词,同时保留原始旋律、总时长以及未编辑区域。本文提出 MeloDISinger,一种基于流匹配(flow-matching)的 SVE 模型,用于旋律感知且保持时长的编辑。其核心模块 MeloDRP 预测固定预算的时长比例,实现显式的跨度级时长控制。对于旋律感知的时长分配,MeloDRP 通过交叉注意力将语音线索与伪 MIDI 旋律上下文相融合,而时间重叠监督则鼓励柔性的音素—音符对应。我们进一步使用流匹配 mel 解码器进行音频填充,以合成编辑区域同时保留周边上下文。此外,我们引入一种基于 WhisperX 和 LLM 的时长感知编辑歌词生成流程,以构建可行的评估场景。实验表明,在客观与主观评价中均取得了最先进的性能。
引用
@article{arxiv.2606.30580,
title = {MeloDISinger: Melody-Aware & Duration-Preserving Singing Voice Editing with Audio Infilling},
author = {Yoonjeong Park and Jaekwon Im and Juhan Nam},
journal= {arXiv preprint arXiv:2606.30580},
year = {2026}
}
备注
Accepted to Interspeech 2026