FlowTSE:基于流匹配的目标说话人提取
音频与语音处理
2025-05-21 v1 机器学习
声音
摘要
目标说话人提取旨在利用说话人注册音频作为参考,从混合语音中分离出特定说话人的语音。尽管现有的大多数方法是判别式的,但近期用于 TSE 的生成式方法取得了显著成果。然而,用于 TSE 的生成式方法仍有待深入探索,现有的大多数方法依赖于复杂的流程和预训练组件,导致计算开销过大。在本工作中,我们提出了 FlowTSE,一种基于条件流匹配的简单而有效的 TSE 方法。我们的模型接收注册音频样本和混合语音信号(两者均表示为 mel 频谱图),目标是提取目标说话人的纯净语音。此外,对于相位重建至关重要的任务,我们提出了一种以混合信号的复 STFT 为条件的新型声码器,从而实现改进的相位估计。在标准 TSE 基准上的实验结果表明,FlowTSE 匹配或超越了强基线方法。
引用
@article{arxiv.2505.14465,
title = {FlowTSE: Target Speaker Extraction with Flow Matching},
author = {Aviv Navon and Aviv Shamsian and Yael Segal-Feldman and Neta Glazer and Gil Hetz and Joseph Keshet},
journal= {arXiv preprint arXiv:2505.14465},
year = {2025}
}
备注
InterSpeech 2025