EdiTTS:基于得分的可控文本转语音编辑
声音
2022-07-12 v3 机器学习
音频与语音处理
摘要
我们提出EdiTTS,一种基于得分生成建模、用于文本转语音合成的现成语音编辑方法。EdiTTS允许对音频进行有针对性的细粒度编辑,涵盖内容与音高,无需任何额外训练、任务特定优化或对得分模型主干的网络结构修改。具体而言,我们在高斯先验空间中施加粗糙而有意的扰动,以诱导扩散模型产生期望行为,同时应用掩码与软化核以确保迭代编辑仅作用于目标区域。通过听感测试与语音转文本回写,我们表明EdiTTS优于现有基线,并生成满足用户设定要求的鲁棒样本。
引用
@article{arxiv.2110.02584,
title = {EdiTTS: Score-based Editing for Controllable Text-to-Speech},
author = {Jaesung Tae and Hyeongju Kim and Taesu Kim},
journal= {arXiv preprint arXiv:2110.02584},
year = {2022}
}
备注
4 pages, 3 figures, 3 tables, INTERSPEECH 2022