基于自监督离散语音表示的任意到一序列到序列语音转换
音频与语音处理
2020-10-26 v1 计算与语言
声音
摘要
我们提出了一种在序列到序列(seq2seq)框架下的任意到一(A2O)语音转换(VC)新方法。A2O VC 旨在将任意说话人(包括训练时未见的说话人)转换为固定的目标说话人。我们利用 vq-wav2vec(VQW2V),一种从大规模无标签数据中学到的离散化自监督语音表示,其被假设为说话人无关且良好对应于底层语言内容。给定目标说话人的训练数据集,我们提取 VQW2V 和声学特征,以估计从前者到后者的 seq2seq 映射函数。借助预训练方法和新设计的后处理技术,我们的模型可泛化到仅 5 分钟数据,甚至优于使用并行数据训练的相同模型。
引用
@article{arxiv.2010.12231,
title = {Any-to-One Sequence-to-Sequence Voice Conversion using Self-Supervised Discrete Speech Representations},
author = {Wen-Chin Huang and Yi-Chiao Wu and Tomoki Hayashi and Tomoki Toda},
journal= {arXiv preprint arXiv:2010.12231},
year = {2020}
}
备注
Submitted to ICASSP 2021