SpeechOp:面向生成式语音处理的推理时任务组合
音频与语音处理
2025-09-19 v1 机器学习
摘要
虽然生成式文本转语音(TTS)系统利用广泛的“in-the-wild”数据取得了显著成功,但语音到语音处理任务如语音增强面临数据限制,这导致数据驱动的生成方法扭曲语音内容和说话人身份。为弥合这一差距,我们提出SpeechOp,一种多任务潜在扩散模型,将预训练的TTS模型转换为一种通用的语音处理器,能够在推理时执行广泛的语音任务并以新方式组合它们。通过适配预训练的TTS模型,SpeechOp继承了对自然语音的丰富理解,加速训练并提高S2S任务质量,同时也增强了核心TTS性能。最后,我们引入了隐式任务组合(ITC),一种新型管道,其中从ASR派生的转录文本(例如来自Whisper)通过我们的原则推理时任务组合指导SpeechOp进行增强。ITC通过鲁棒地将大规模语音理解与SpeechOp的生成能力相结合,实现了对内容保留的state-of-the-art。音频样本可在https://justinlovelace.github.io/projects/speechop 查阅。
引用
@article{arxiv.2509.14298,
title = {SpeechOp: Inference-Time Task Composition for Generative Speech Processing},
author = {Justin Lovelace and Rithesh Kumar and Jiaqi Su and Ke Chen and Kilian Q Weinberger and Zeyu Jin},
journal= {arXiv preprint arXiv:2509.14298},
year = {2025}
}