中文

SpeechPainter:基于文本条件的语音修复

声音 2022-03-31 v2 机器学习 音频与语音处理

摘要

我们提出 SpeechPainter,一种通过利用辅助文本输入来填补语音样本中长达一秒间隙的模型。我们证明该模型能以恰当的内容进行语音修复,同时保持说话人身份、韵律和录音环境条件,并能泛化到未见过的说话人。由人工评测者在并排偏好测试和 MOS 测试中判断,我们的方法显著优于使用自适应 TTS 构建的基线。

关键词

引用

@article{arxiv.2202.07273,
  title  = {SpeechPainter: Text-conditioned Speech Inpainting},
  author = {Zalán Borsos and Matt Sharifi and Marco Tagliasacchi},
  journal= {arXiv preprint arXiv:2202.07273},
  year   = {2022}
}

备注

Submitted to Interspeech 2022