中文

无风格标签:基于量化VAE与说话人归一化的语音合成跨说话人风格迁移

声音 2022-12-14 v1 人工智能 计算与语言 音频与语音处理

摘要

语音合成中的跨说话人风格迁移旨在将源说话人的风格迁移到具有目标说话人音色的合成语音中。大多数先前的方法依赖于带风格标签的数据,但人工标注的标签成本高昂且并非总是可靠。针对这一问题,我们提出 Style-Label-Free,一种跨说话人风格迁移方法,可在无风格标签的情况下实现从源说话人到目标说话人的风格迁移。首先,设计了一种基于量化变分自编码器(Q-VAE)与风格瓶颈的参考编码器结构,以提取离散风格表示。其次,提出一种说话人批量归一化层,以减少源说话人信息泄漏。为提升参考编码器的风格提取能力,提出了一种风格不变与对比的数据增强方法。实验结果表明该方法优于基线。我们提供了一个包含音频样本的网站。

关键词

引用

@article{arxiv.2212.06397,
  title  = {Style-Label-Free: Cross-Speaker Style Transfer by Quantized VAE and Speaker-wise Normalization in Speech Synthesis},
  author = {Chunyu Qiang and Peng Yang and Hao Che and Xiaorui Wang and Zhongyuan Wang},
  journal= {arXiv preprint arXiv:2212.06397},
  year   = {2022}
}

备注

Published to ISCSLP 2022