中文

FlowTSE:基于流匹配的目标说话人提取

音频与语音处理 2025-05-21 v1 机器学习 声音

摘要

目标说话人提取旨在利用说话人注册音频作为参考,从混合语音中分离出特定说话人的语音。尽管现有的大多数方法是判别式的,但近期用于 TSE 的生成式方法取得了显著成果。然而,用于 TSE 的生成式方法仍有待深入探索,现有的大多数方法依赖于复杂的流程和预训练组件,导致计算开销过大。在本工作中,我们提出了 FlowTSE,一种基于条件流匹配的简单而有效的 TSE 方法。我们的模型接收注册音频样本和混合语音信号(两者均表示为 mel 频谱图),目标是提取目标说话人的纯净语音。此外,对于相位重建至关重要的任务,我们提出了一种以混合信号的复 STFT 为条件的新型声码器,从而实现改进的相位估计。在标准 TSE 基准上的实验结果表明,FlowTSE 匹配或超越了强基线方法。

关键词

引用

@article{arxiv.2505.14465,
  title  = {FlowTSE: Target Speaker Extraction with Flow Matching},
  author = {Aviv Navon and Aviv Shamsian and Yael Segal-Feldman and Neta Glazer and Gil Hetz and Joseph Keshet},
  journal= {arXiv preprint arXiv:2505.14465},
  year   = {2025}
}

备注

InterSpeech 2025