中文

基于位置相对序列到序列建模的任意到多说话人语音转换

音频与语音处理 2021-05-25 v3 计算与语言 声音

摘要

本文提出一种任意到多、位置相对、序列到序列(seq2seq)、非平行的语音转换方法,其在训练期间利用文本监督。在该方法中,我们将瓶颈特征提取器(BNE)与seq2seq合成模块相结合。在训练阶段,训练一个基于编码器-解码器的混合连接时序分类-注意力(CTC-attention)音素识别器,其编码器具有瓶颈层。从音素识别器获得BNE,并用于从谱特征中提取说话人无关、稠密且丰富的语音内容表示。然后训练一个多说话人基于位置相对注意力的seq2seq合成模型,从瓶颈特征重建谱特征,并以说话人表示为条件以控制生成语音中的说话人身份。为缓解使用seq2seq模型对齐长序列的困难,我们沿时间维度对输入谱特征下采样,并为合成模型配备离散逻辑混合(MoL)注意力机制。由于音素识别器使用大型语音识别语料库训练,所提方法能进行任意到多语音转换。客观与主观评价表明,所提任意到多方法在自然度和说话人相似度方面均具有优越的语音转换性能。我们进行了消融研究以确认所提方法中特征选择和模型设计策略的有效性。所提VC方法可容易地扩展以支持任意到任意VC(也称为一次/少样本VC),并根据客观和主观评价取得高性能。

关键词

引用

@article{arxiv.2009.02725,
  title  = {Any-to-Many Voice Conversion with Location-Relative Sequence-to-Sequence Modeling},
  author = {Songxiang Liu and Yuewen Cao and Disong Wang and Xixin Wu and Xunying Liu and Helen Meng},
  journal= {arXiv preprint arXiv:2009.02725},
  year   = {2021}
}

备注

Accepted by IEEE/ACM Transactions on Audio, Speech and Language Processing