用于语音生成的细粒度定量情感编辑
声音
2024-10-01 v2 音频与语音处理
摘要
在语音生成中如何定量控制语音情感的表现力仍是一个重大挑战。本工作提出了一种用于操纵语音生成情感渲染的新方法。我们提出了一种分层情感分布提取器 (Hierarchical Emotion Distribution extractor, 即 Hierarchical ED),用于量化不同粒度级别上的情感强度。采用支持向量机 (SVM) 对情感强度进行排序,从而生成分层情感嵌入。随后,将 Hierarchical ED 集成到 FastSpeech2 框架中,引导模型在音素、词和话语级别学习情感强度。在合成过程中,用户可以手动编辑生成语音的情感强度。客观和主观评估均证明了所提网络在细粒度定量情感编辑方面的有效性。
关键词
引用
@article{arxiv.2403.02002,
title = {Fine-Grained Quantitative Emotion Editing for Speech Generation},
author = {Sho Inoue and Kun Zhou and Shuai Wang and Haizhou Li},
journal= {arXiv preprint arXiv:2403.02002},
year = {2024}
}
备注
This is accepted to IEEE APSIPA ASC 2024