CosyEdit:释放零样本文本转语音模型的端到端语音编辑能力
声音
2026-01-12 v1 音频与语音处理
摘要
自动语音编辑旨在根据文本指令修改语音内容,然而传统的级联系统存在预处理流程复杂且依赖显式外部时间对齐的问题。针对这些局限性,我们提出了 CosyEdit,这是一种通过特定任务微调和优化推理过程从 CosyVoice 改进而来的端到端语音编辑模型,它将语音-文本对齐内化,同时确保编辑前后语音的高度一致性。仅在我们精心整理的 GigaEdit 数据集上使用 250 小时的监督数据进行微调,我们具有 400M 参数的模型便实现了可靠的语音编辑性能。在 RealEdit 基准上的实验表明,CosyEdit 不仅优于数十亿参数级别的语言模型基线,还达到了最先进的级联方法的性能。这些结果表明,通过特定任务微调和推理优化,可以从零样本 TTS 模型中释放强大且高效的语音编辑能力,为高质量语音编辑提供了一种新颖且高性价比的端到端解决方案。
引用
@article{arxiv.2601.05329,
title = {CosyEdit: Unlocking End-to-End Speech Editing Capability from Zero-Shot Text-to-Speech Models},
author = {Junyang Chen and Yuhang Jia and Hui Wang and Jiaming Zhou and Yaxin Han and Mengying Feng and Yong Qin},
journal= {arXiv preprint arXiv:2601.05329},
year = {2026}
}