SpeechPainter:基于文本条件的语音修复
声音
2022-03-31 v2 机器学习
音频与语音处理
摘要
我们提出 SpeechPainter,一种通过利用辅助文本输入来填补语音样本中长达一秒间隙的模型。我们证明该模型能以恰当的内容进行语音修复,同时保持说话人身份、韵律和录音环境条件,并能泛化到未见过的说话人。由人工评测者在并排偏好测试和 MOS 测试中判断,我们的方法显著优于使用自适应 TTS 构建的基线。
引用
@article{arxiv.2202.07273,
title = {SpeechPainter: Text-conditioned Speech Inpainting},
author = {Zalán Borsos and Matt Sharifi and Marco Tagliasacchi},
journal= {arXiv preprint arXiv:2202.07273},
year = {2022}
}
备注
Submitted to Interspeech 2022