中文

S3PRL-VC:基于自监督语音表征的开源语音转换框架

声音 2021-10-14 v1 计算与语言 机器学习 音频与语音处理

摘要

本文介绍 S3PRL-VC,一个基于 S3PRL 工具包的开源语音转换(VC)框架。在识别-合成式 VC 背景下,自监督语音表征(S3R)因其有望替代最先进 VC 系统所采用的昂贵有监督表征而具有价值。此外,我们主张 VC 是分析 S3R 的一个良好探测任务。本工作中,我们通过在 VCC2020 的两项任务(即语内/跨语言任意到一(A2O)VC,以及任意到任意(A2A)设定)上的基准测试提供了一系列深入分析。我们还提供了不同 S3R 之间以及采用有监督表征的 VCC2020 顶尖系统之间的比较。进行了系统的客观与主观评价,表明在相似度方面 S3R 在 A2O 设定下可与 VCC2020 顶尖系统相媲美,并在基于 S3R 的 A2A VC 中达到最先进水平。我们相信这一广泛分析以及工具包本身不仅有益于 S3R 社区,也有益于 VC 社区。代码库现已开源。

关键词

引用

@article{arxiv.2110.06280,
  title  = {S3PRL-VC: Open-source Voice Conversion Framework with Self-supervised Speech Representations},
  author = {Wen-Chin Huang and Shu-Wen Yang and Tomoki Hayashi and Hung-Yi Lee and Shinji Watanabe and Tomoki Toda},
  journal= {arXiv preprint arXiv:2110.06280},
  year   = {2021}
}

备注

Submitted to ICASSP 2022. Code available at: https://github.com/s3prl/s3prl/tree/master/s3prl/downstream/a2o-vc-vcc2020