可情绪选择的端到端基于文本的语音编辑
声音
2022-12-21 v1 计算与语言
机器学习
音频与语音处理
摘要
基于文本的语音编辑允许用户通过直观地剪切、复制和粘贴文本来编辑语音,从而加快语音编辑过程。在先前的工作中,CampNet(上下文感知掩码预测网络)被提出以实现基于文本的语音编辑,显著提升了编辑后语音的质量。本文旨在完成一项新任务:在基于文本的语音编辑过程中为编辑后的语音添加情感效果,使生成的语音更具表现力。为实现该任务,我们提出 Emo-CampNet(情感 CampNet),它能在基于文本的语音编辑中为生成语音提供情感属性选项,并具备编辑未见说话人语音的一次性能力。首先,我们提出一种端到端可情绪选择的基于文本的语音编辑模型。该模型的核心思想是在上下文感知掩码预测网络基础上引入额外的情感属性来控制生成语音的情感。其次,为防止生成语音的情感受原始语音中情感成分的干扰,提出中性内容生成器以去除原始语音中的情感,该生成器由生成对抗框架优化。第三,提出两种数据增强方法以丰富训练集中的情感与发音信息,使模型能够编辑未见说话人的语音。实验结果表明:1) Emo-CampNet 能在基于文本的语音编辑过程中有效控制生成语音的情感,并可编辑未见说话人的语音;2) 详细的消融实验进一步证明了情绪选择性与数据增强方法的有效性。演示页面见 https://hairuo55.github.io/Emo-CampNet/
引用
@article{arxiv.2212.10191,
title = {Emotion Selectable End-to-End Text-based Speech Editing},
author = {Tao Wang and Jiangyan Yi and Ruibo Fu and Jianhua Tao and Zhengqi Wen and Chu Yuan Zhang},
journal= {arXiv preprint arXiv:2212.10191},
year = {2022}
}
备注
Under review, 12 pages, 11 figures, demo page is available at https://hairuo55.github.io/Emo-CampNet/