中文

基于大规模语音与歌唱数据的语音转换模型比较研究:歌唱语音转换挑战赛2023的T13系统

音频与语音处理 2023-10-10 v1 计算与语言 机器学习 声音 信号处理

摘要

本文介绍了我们为2023年歌唱语音转换挑战赛(SVCC)所构建的系统(记为T13)。对于域内与跨域的英文歌唱语音转换(SVC)任务(任务1与任务2),我们采用了基于自监督学习表征的识别-合成方法。为了在目标歌手/说话人数据量有限(SVCC 2023中为150至160条语句)的情况下实现数据高效的SVC,我们首先使用公开可用的大规模750小时语音与歌唱数据训练了一个基于扩散的任意到任意语音转换模型。随后,我们针对任务1和任务2的各个目标歌手/说话人微调该模型。SVCC 2023开展的大规模听测表明,我们的T13系统在更难的跨域SVC(任务2)上取得了具有竞争力的自然度与说话人相似度,这意味着我们所提方法的泛化能力。我们的客观评估结果显示,使用大规模数据集尤其有益于跨域SVC。

关键词

引用

@article{arxiv.2310.05203,
  title  = {A Comparative Study of Voice Conversion Models with Large-Scale Speech and Singing Data: The T13 Systems for the Singing Voice Conversion Challenge 2023},
  author = {Ryuichi Yamamoto and Reo Yoneyama and Lester Phillip Violeta and Wen-Chin Huang and Tomoki Toda},
  journal= {arXiv preprint arXiv:2310.05203},
  year   = {2023}
}

备注

Accepted to ASRU 2023