CONTUNER:基于音高与表现力条件的唱声美化
声音
2024-05-01 v1 音频与语音处理
摘要
唱声美化是一种具有实际应用价值的新任务,旨在纠正唱声音的音高并提升表现力,而不改变原始音色和内容。现有方法依赖配对数据或仅关注音高校正。然而,专业歌曲和同一人的业余歌曲难以获得,唱声美化不仅包含音高校正,还包括情感和节奏等其他方面。由于我们提出了一个快速且高保真度的唱声美化系统 ConTuner,将扩散模型与修改后的条件相结合来生成美化后的 Mel 频谱,其中修改后的条件由优化后的音高和表现力组成。对于音高校正,我们建立了从 MIDI、频谱包络到音高的映射关系。为使业余唱声更具表现力,我们提出了在潜空间中进行表现力增强器,以将业余人声调制为专业人声。ConTuner 在中文和英文歌曲上实现了令人满意的美化效果。消融研究表明,ConTuner 中的表现力增强器和基于生成器的加速方法有效。
引用
@article{arxiv.2404.19187,
title = {CONTUNER: Singing Voice Beautifying with Pitch and Expressiveness Condition},
author = {Jianzong Wang and Pengcheng Li and Xulong Zhang and Ning Cheng and Jing Xiao},
journal= {arXiv preprint arXiv:2404.19187},
year = {2024}
}
备注
Accepted by the 2024 International Joint Conference on Neural Networks (IJCNN 2024)