Compose Yourself:用于单步语音增强的平均速度流匹配
声音
2025-09-23 v2 人工智能
机器学习
音频与语音处理
摘要
扩散和流匹配 (FM) 模型在语音增强 (SE) 方面取得了显著进展,但它们对多步生成的依赖在计算上代价高昂且易受离散化误差影响。单步生成建模的最新进展,特别是 MeanFlow,通过平均速度场重新表述动力学,提供了一种有前景的替代方案。在本工作中,我们提出了 COSE,一个为 SE 量身定制的单步 FM 框架。为了解决 MeanFlow 中 Jacobian-vector product (JVP) 计算的高训练开销问题,我们引入了速度复合恒等式来高效计算平均速度,在消除昂贵计算的同时保持了理论一致性并实现了具竞争力的增强质量。在标准基准上的大量实验表明,COSE 提供了高达 5 倍的采样速度,并将训练成本降低了 40%,且所有这些均未妥协语音质量。代码可在 https://github.com/ICDM-UESTC/COSE 获取。
引用
@article{arxiv.2509.15952,
title = {Compose Yourself: Average-Velocity Flow Matching for One-Step Speech Enhancement},
author = {Gang Yang and Yue Lei and Wenxin Tai and Jin Wu and Jia Chen and Ting Zhong and Fan Zhou},
journal= {arXiv preprint arXiv:2509.15952},
year = {2025}
}
备注
5 pages, 2 figures, submitted to ICASSP 2026