中文

通过条件流匹配实现更直的路径以提升语音增强精度

声音 2025-08-29 v1 人工智能 机器学习

摘要

当前基于流的生成式语音增强方法学习弯曲的概率路径,建模干净语音与噪声语音之间的映射。尽管性能令人印象深刻,但弯曲概率路径的影响尚不明确。薛定谔桥等方法关注弯曲路径,其中时间依赖的梯度和方差并不促进直路径。机器学习研究的发现表明,直路径(如条件流匹配)更易于训练且泛化更好。在本文中,我们量化了路径直度对语音增强质量的影响。我们报告了薛定谔桥的实验,表明某些配置可产生更直的路径。相反,我们提出用于语音增强的独立条件流匹配,该方法建模噪声语音与干净语音之间的直路径。我们经验性地证明,时间无关的方差对样本质量的影响大于梯度。尽管条件流匹配改善了若干语音质量指标,但它需要多步推理。我们通过将训练好的基于流的模型视为直接预测器来进行一步推理,从而纠正了这一点。我们的工作表明,更直的、时间无关的概率路径优于弯曲的、时间依赖的路径,能够提升生成式语音增强效果。

关键词

引用

@article{arxiv.2508.20584,
  title  = {Flowing Straighter with Conditional Flow Matching for Accurate Speech Enhancement},
  author = {Mattias Cross and Anton Ragni},
  journal= {arXiv preprint arXiv:2508.20584},
  year   = {2025}
}

备注

preprint, accepted