FluentEditor2:通过建模多尺度声学和韵律一致性实现基于文本的语音编辑
计算与语言
2024-12-10 v2 声音
音频与语音处理
摘要
基于文本的语音编辑(TSE)允许用户通过直接修改与语音对应的文本来编辑语音,而无需改变原始录音。当前的 TSE 技术通常侧重于最小化生成语音与参考语音在编辑区域内的差异,以实现流畅的 TSE 性能。然而,编辑区域生成的语音应在局部和全局层面上保持与未编辑区域以及原始语音的声学和韵律一致性。为维持语音流畅性,我们提出了一种新的流畅语音编辑方案,基于我们之前的 FluentEditor 模型,称为 FluentEditor2,通过在 TSE 训练中建模多尺度声学和韵律一致性训练准则。具体而言,对于局部声学一致性,我们提出了分层局部声学光滑约束,以对齐语音帧、音素和单词的声学属性,在生成语音的编辑区域与未编辑区域语音的边界处。对于全局韵律一致性,我们提出了对比全局韵律一致性约束,以保持编辑区域的语音与原始语音的韵律一致。在 VCTK 和 LibriTTS 数据集上进行大量实验表明,FluentEditor2 在主观和客观指标上均优于现有的神经网络-based TSE 方法,包括 Editspeech、Campnet、A³T、FluentSpeech 和我们的 FluentEditor。消融研究进一步突显了每个模块对整个系统有效性的贡献。语音演示可在 https://github.com/Ai-S2-Lab/FluentEditor2 查看。
关键词
引用
@article{arxiv.2410.03719,
title = {FluentEditor2: Text-based Speech Editing by Modeling Multi-Scale Acoustic and Prosody Consistency},
author = {Rui Liu and Jiatian Xi and Ziyue Jiang and Haizhou Li},
journal= {arXiv preprint arXiv:2410.03719},
year = {2024}
}
备注
submitted for an IEEE publication