中文

FluentSpeech:基于上下文感知扩散模型的口吃导向自动语音编辑

声音 2023-05-24 v1 音频与语音处理

摘要

口吃去除是语音编辑领域中的一个重要场景。然而,当语音录音包含口吃时,现有基于文本的语音编辑方法仍存在以下不足:1)编辑后语音的过平滑问题;2)因口吃引入噪声导致的鲁棒性缺失;3)为去除口吃,用户需手动确定编辑区域。为应对口吃去除中的挑战,我们提出 FluentSpeech,一种口吃导向的自动语音编辑模型。具体而言:1)我们提出一种上下文感知扩散模型,在上下文特征引导下迭代优化修改后的梅尔频谱图;2)我们引入口吃预测模块,将口吃信息注入隐藏序列;3)我们还提出一个口吃导向自动语音编辑(SASE)数据集,包含带有时间对齐口吃标注的自发语音录音,用于训练自动口吃定位模型。在 VCTK 和 LibriTTS 数据集上的实验结果表明,我们的模型在语音编辑上取得了最先进的性能。在我们 SASE 数据集上的进一步实验显示,FluentSpeech 能在客观与主观指标上有效提升口吃语音的流畅度。代码与音频样本见 https://github.com/Zain-Jiang/Speech-Editing-Toolkit。

关键词

引用

@article{arxiv.2305.13612,
  title  = {FluentSpeech: Stutter-Oriented Automatic Speech Editing with Context-Aware Diffusion Models},
  author = {Ziyue Jiang and Qian Yang and Jialong Zuo and Zhenhui Ye and Rongjie Huang and Yi Ren and Zhou Zhao},
  journal= {arXiv preprint arXiv:2305.13612},
  year   = {2023}
}

备注

Accepted by ACL 2023 (Findings)