中文

DRVC:一种基于自监督学习的任意到任意语音转换框架

声音 2022-02-23 v1 音频与语音处理

摘要

任意到任意语音转换问题旨在为训练数据之外的源说话人与目标说话人转换语音。以往的工作广泛采用基于解耦的模型。基于解耦的模型假设语音由内容与说话人风格信息组成,并旨在将其解耦以更改风格信息实现转换。以往工作侧重于降低语音维度以获取内容信息,但维度大小难以确定,导致解耦重叠问题。我们提出解耦表示语音转换(DRVC)模型来解决该问题。DRVC 模型是一个端到端自监督模型,由内容编码器、音色编码器和生成器组成。与以往通过压缩语音尺寸获取内容的工作不同,我们提出利用循环重建损失与相同损失来约束解耦的循环。实验表明,转换语音在质量与音色相似度上均有提升。

关键词

引用

@article{arxiv.2202.10976,
  title  = {DRVC: A Framework of Any-to-Any Voice Conversion with Self-Supervised Learning},
  author = {Qiqi Wang and Xulong Zhang and Jianzong Wang and Ning Cheng and Jing Xiao},
  journal= {arXiv preprint arXiv:2202.10976},
  year   = {2022}
}

备注

Published at ICASSP 2022