论社会说话人特征在合成语音中的融入
声音
2022-04-05 v1 人机交互
音频与语音处理
摘要
在我们之前的工作中,我们推导了有助于感知合成语音中温暖与能力的声学特征。作为扩展,在当前工作中我们研究所推导发声特征在生成期望特征中的影响。我们探索了声学特征谱通量、F1 均值与 F2 均值及其凸组合用于生成女性语音中更高温暖度。我们研究了浊音斜率、谱通量及其凸组合用于生成女性语音中更高能力度。我们在传统的端到端基于 tacotron 的语音合成模型中采用了特征量化方法。听感测试表明,与单个特征相比,声学特征的凸组合展现出更高的温暖与能力平均意见得分(Mean Opinion Score)。
引用
@article{arxiv.2204.01115,
title = {On incorporating social speaker characteristics in synthetic speech},
author = {Sai Sirisha Rallabandi and Sebastian Möller},
journal= {arXiv preprint arXiv:2204.01115},
year = {2022}
}
备注
Submitted to Interspeech 2022