UniFlow:基于连续生成建模统一语音前端任务
音频与语音处理
2025-08-12 v1
摘要
生成式建模近期在图像、视频和音频领域取得了显著成功,展现出强大的统一表征学习能力。然而,语音前端任务(如语音增强、目标说话人提取、声学回声消除和语言查询源分离)仍主要通过分散的、任务特定的解决方案来解决。这导致工程冗余、性能不一致和可扩展性有限。为弥合这一差距,我们介绍UniFlow,一个统一框架,采用连续生成建模来在共享潜在空间中处理多样化语音前端任务。具体而言,UniFlow利用波形变分自编码器(VAE)学习原始音频的紧凑潜在表示,配合 Diffusion Transformer(DiT)预测潜在更新。为在训练期间区分语音处理任务,可使用以任务ID为索引的可学习条件嵌入,以实现最大参数共享的同时保留任务特定的适应性。为平衡模型性能和计算效率,我们研究并比较了三种生成目标:去噪扩散、流匹配和均值流。我们在多个公开基准上验证了UniFlow,证明其 consistently 超越最先进的基线。UniFlow的统一潜在表述和条件设计使其易于扩展到新任务,为构建和扩展生成式语音处理管道提供了集成基础。为促进未来研究,我们将开源我们的代码。
引用
@article{arxiv.2508.07558,
title = {UniFlow: Unifying Speech Front-End Tasks via Continuous Generative Modeling},
author = {Ziqian Wang and Zikai Liu and Yike Zhu and Xingchen Li and Boyi Kang and Jixun Yao and Xianjun Xia and Chuanzeng Huang and Lei Xie},
journal= {arXiv preprint arXiv:2508.07558},
year = {2025}
}
备注
extended version