中文

基于条件解耦序列VAE的无监督TTS声学建模

音频与语音处理 2024-10-08 v4 人工智能 计算与语言 机器学习 声音

摘要

本文提出一种新颖的无监督文本到语音声学模型训练方案,名为 UTTS,其不需要文本-音频配对。UTTS 是一种支持零样本声音克隆的多说话人语音合成器,从解耦语音表征学习的视角开发。该框架为 TTS 推理提供了对说话人时长模型、音色特征(身份)与内容的灵活选择。我们利用自监督语音表征学习以及语音合成前端技术的最新进展进行系统开发。具体而言,我们采用近期提出的的条件解耦序列变分自编码器(C-DSVAE)作为 UTTS 声学模型骨干,其在训练时以无监督对齐(UA)为条件提供结构良好的内容表征。对于 UTTS 推理,我们利用词典将输入文本映射为音素序列,并通过说话人相关时长模型扩展为帧级强制对齐(FA)。然后,我们开发对齐映射模块将 FA 转换为 UA。最后,作为自监督 TTS 声学模型的 C-DSVAE 采用预测的 UA 与目标说话人嵌入生成梅尔频谱,并最终由神经声码器转换为波形。我们展示了我们的方法如何在 AM 开发阶段不使用配对 TTS 语料库即可实现语音合成。实验表明,UTTS 可合成出由主观与客观评测测得高自然度与可懂度的语音。音频样本见演示页 https://neurtts.github.io/utts\_demo/。

关键词

引用

@article{arxiv.2206.02512,
  title  = {Unsupervised TTS Acoustic Modeling for TTS with Conditional Disentangled Sequential VAE},
  author = {Jiachen Lian and Chunlei Zhang and Gopala Krishna Anumanchipalli and Dong Yu},
  journal= {arXiv preprint arXiv:2206.02512},
  year   = {2024}
}

备注

IEEE/ACM Transactions on Audio, Speech, and Language Processing ( Volume: 31)