SSR-Speech:面向稳定、安全与鲁棒的零样本文本基语音编辑与合成
音频与语音处理
2025-01-03 v2 声音
摘要
本文提出SSR-Speech,一种用于稳定、安全和鲁棒的零样本文本基语音编辑和文本转语音合成的神经编解码器自回归模型。SSR-Speech基于Transformer解码器,并采用无分类器引导以增强生成过程的稳定性。提出一种水印化编码器,用于将编辑区域的帧级水印嵌入语音中,以检测哪些部分被编辑了。在此基础上,波形重建利用原始未编辑语音片段,相较于编解码器模型具有更佳的恢复效果。我们的方法在RealEdit语音编辑任务和LibriTTS文本转语音任务上实现了领先的性能,超越了先前的方法。此外,SSR-Speech在多段语音编辑方面表现出色,并且在面对背景声时展现出卓越的鲁棒性。我们公开了源代码和演示。
引用
@article{arxiv.2409.07556,
title = {SSR-Speech: Towards Stable, Safe and Robust Zero-shot Text-based Speech Editing and Synthesis},
author = {Helin Wang and Meng Yu and Jiarui Hai and Chen Chen and Yuchen Hu and Rilin Chen and Najim Dehak and Dong Yu},
journal= {arXiv preprint arXiv:2409.07556},
year = {2025}
}
备注
ICASSP 2025