CartoonSing:统一人类与非人类演唱 timbre
声音
2025-11-27 v1
摘要
演唱语音合成(SVS)和演唱语音转换(SVC)在生成自然听感的人类演唱方面取得了显著进展。然而,现有系统局限于人类 timbre,难以合成人类范围之外的声音,这种需求在视频游戏、电影和虚拟角色等创意应用中日益增长。我们提出了非人类演唱生成(NHSG),涵盖非人类演唱语音合成(NHSVS)和非人类演唱语音转换(NHSVC),作为一种新的机器学习任务,用于生成具有非人类 timbre 特征的音乐连贯演唱。NHSG 由于非人类演唱数据的稀缺、缺乏符号对齐以及人类与非人类声音之间的 timbre 鸿沟而具有挑战性。为此,我们提出了 CartoonSing,一个统一框架,将演唱语音合成和转换整合在一起,同时桥接人类和非人类演唱生成。CartoonSing 采用两阶段流程:一个使用标注的人类演唱数据训练的得分表示编码器,以及能够为人类和非人类音频重构波形的 timbre-aware 声码器。实验表明,CartoonSing 成功生成了非人类演唱声音,能够推广到新 timbre,并将传统的 SVS 和 SVC 扩展到创意、非人类演唱生成。
关键词
引用
@article{arxiv.2511.21045,
title = {CartoonSing: Unifying Human and Nonhuman Timbres in Singing Generation},
author = {Jionghao Han and Jiatong Shi and Zhuoyan Tao and Yuxun Tang and Yiwen Zhao and Gus Xia and Shinji Watanabe},
journal= {arXiv preprint arXiv:2511.21045},
year = {2025}
}