CoMelSinger:基于离散Token的零样本歌声合成,兼具结构化旋律控制与引导
声音
2026-04-14 v2 人工智能
摘要
歌声合成(SVS)旨在从结构化音乐输入(如歌词和音高序列)生成富有表现力的声乐表演。尽管基于离散编解码器的语音合成最新进展已通过上下文学习实现了零样本生成,但将这些技术直接扩展到SVS仍非易事,因为需要精确的旋律控制。特别是,基于提示的生成常引入韵律泄漏,即音高信息被意外纠缠在音色提示中,损害了可控性。我们提出了CoMelSinger,一个零样本SVS框架,能够在离散编解码器建模范式内实现结构化和解耦的旋律控制。基于非自回归MaskGCT架构,CoMelSinger用歌词和音高token替换常规文本输入,在保持上下文泛化能力的同时增强了旋律条件化。为抑制韵律泄漏,我们提出了一种粗到细的对比学习策略,明确正则化声学提示与旋律输入之间的音高冗余。此外,我们引入了一个轻量级仅编码器歌唱语音转录(SVT)模块,将声学token与音高和时长对齐,提供细粒度的帧级监督。实验结果表明,CoMelSinger在音高准确性、音色一致性和零样本迁移性方面相对于竞争基线取得了显著提升。音频样本可在https://danny-nus.github.io/CoMelSinger/获取。
引用
@article{arxiv.2509.19883,
title = {CoMelSinger: Discrete Token-Based Zero-Shot Singing Synthesis With Structured Melody Control and Guidance},
author = {Junchuan Zhao and Wei Zeng and Tianle Lyu and Ye Wang},
journal= {arXiv preprint arXiv:2509.19883},
year = {2026}
}
备注
Published in IEEE Transactions on Audio, Speech and Language Processing (TASLP). 13 pages, 5 figures, 5 tables