中文

歌声数据规模扩展:ACE-Opencpop 与 ACE-KiSing 简介

声音 2024-06-14 v3 音频与语音处理

摘要

在歌声合成(SVS)中,由于数据可用性有限,从乐谱生成歌声面临挑战。本研究提出了一种独特的策略来解决 SVS 中的数据稀缺问题。我们采用现有的歌声合成器进行数据增强,并辅以细致的手动调校——这是一种在数据整理中未曾探索过的方法,旨在减少不自然语音合成的实例。这种创新方法促成了两个大规模歌声数据集 ACE-Opencpop 和 ACE-KiSing 的创建,它们对于大规模、多歌手语音合成具有重要作用。通过全面的实验,我们证明这些数据集不仅可作为 SVS 的新基准,而且在作为补充资源使用时,还能提升在其他歌声数据集上的 SVS 性能。语料库、预训练模型及其相关的训练方案已在 ESPnet-Muskits (\url{https://github.com/espnet/espnet}) 公开提供。

关键词

引用

@article{arxiv.2401.17619,
  title  = {Singing Voice Data Scaling-up: An Introduction to ACE-Opencpop and ACE-KiSing},
  author = {Jiatong Shi and Yueqian Lin and Xinyi Bai and Keyi Zhang and Yuning Wu and Yuxun Tang and Yifeng Yu and Qin Jin and Shinji Watanabe},
  journal= {arXiv preprint arXiv:2401.17619},
  year   = {2024}
}

备注

Accepted by Interspeech2024