中文

基于自监督离散语音表示的任意到一序列到序列语音转换

音频与语音处理 2020-10-26 v1 计算与语言 声音

摘要

我们提出了一种在序列到序列(seq2seq)框架下的任意到一(A2O)语音转换(VC)新方法。A2O VC 旨在将任意说话人(包括训练时未见的说话人)转换为固定的目标说话人。我们利用 vq-wav2vec(VQW2V),一种从大规模无标签数据中学到的离散化自监督语音表示,其被假设为说话人无关且良好对应于底层语言内容。给定目标说话人的训练数据集,我们提取 VQW2V 和声学特征,以估计从前者到后者的 seq2seq 映射函数。借助预训练方法和新设计的后处理技术,我们的模型可泛化到仅 5 分钟数据,甚至优于使用并行数据训练的相同模型。

关键词

引用

@article{arxiv.2010.12231,
  title  = {Any-to-One Sequence-to-Sequence Voice Conversion using Self-Supervised Discrete Speech Representations},
  author = {Wen-Chin Huang and Yi-Chiao Wu and Tomoki Hayashi and Tomoki Toda},
  journal= {arXiv preprint arXiv:2010.12231},
  year   = {2020}
}

备注

Submitted to ICASSP 2021