基于说话人条件层归一化与半监督训练的跨说话人情感迁移文本到语音合成
音频与语音处理
2021-10-12 v2 声音
摘要
在表现力语音合成中,对情感演绎有较高要求。然而,由于任意说话人的演绎能力,获取其情感音频语料十分耗时。针对该问题,本文提出一种跨说话人情感迁移方法,可实现从源说话人到目标说话人的情感迁移。首先定义一组情感词(token)以表示各类情感。通过交叉熵损失与半监督训练策略,将其训练为与相应情感高度相关以实现可控合成。同时,为消除跨说话人情感迁移对音色相似度的劣化,采用说话人条件层归一化建模说话人特征。实验结果表明,所提方法在音色相似度、稳定性与情感感知评测上优于基于多参考的基线。
引用
@article{arxiv.2110.04153,
title = {Cross-speaker Emotion Transfer Based on Speaker Condition Layer Normalization and Semi-Supervised Training in Text-To-Speech},
author = {Pengfei Wu and Junjie Pan and Chenchang Xu and Junhui Zhang and Lin Wu and Xiang Yin and Zejun Ma},
journal= {arXiv preprint arXiv:2110.04153},
year = {2021}
}
备注
Submitted to ICASSP 2022, 5 pages,2 figures