通过半监督风格提取器与分层建模改进跨说话人语音合成中的韵律风格迁移
声音
2023-03-15 v1 人工智能
计算与语言
音频与语音处理
摘要
语音合成中的跨说话人风格迁移旨在将源说话人的风格迁移到具有目标说话人音色的合成语音中。在以往大多数方法中,合成出的细粒度韵律特征往往表征的是源说话人的平均风格,类似于一对多问题(即多种韵律变化对应于同一文本)。针对该问题,本文提出一种强度可控的半监督风格提取器,将风格从内容与音色中解耦,提升全局风格嵌入的表征能力与可解释性,从而缓解韵律预测中的一对多映射与数据不平衡问题。提出一种分层韵律预测器以改进韵律建模。我们发现,利用易于预测的源说话人韵律特征可实现更好的风格迁移。此外,提出一种说话人迁移式循环一致性损失,以辅助模型在训练阶段学习未见的风格-音色组合。实验结果表明该方法优于基线。我们提供了一个含音频样本的网站。
引用
@article{arxiv.2303.07711,
title = {Improving Prosody for Cross-Speaker Style Transfer by Semi-Supervised Style Extractor and Hierarchical Modeling in Speech Synthesis},
author = {Chunyu Qiang and Peng Yang and Hao Che and Ying Zhang and Xiaorui Wang and Zhongyuan Wang},
journal= {arXiv preprint arXiv:2303.07711},
year = {2023}
}
备注
Accepted by ICASSP2023