Mask2Flow-TSE:基于掩码和流匹配的双阶段目标说话人提取
声音
2026-03-16 v1 人工智能
摘要
目标说话人提取(TSE)从重叠语音混合信号中提取给定参考语音的目标说话人声线。现有方法通常分为两类:判别式和生成式。判别式方法应用时频掩码实现快速推断,但常过抑制目标信号;生成式方法则以大量迭代步骤合成高质量语音。我们提出Mask2Flow-TSE,一个双阶段框架,结合两类方法的优势。第一阶段应用判别式掩码进行粗分割,第二阶段采用流匹配对输出进行细化,逼近目标语音。不同于从高斯噪声合成语音的方法,本方法从掩码时频谱开始,实现单步推断的高质量重构。实验表明,Mask2Flow-TSE在约850万参数下,达到与现有生成式TSE方法相当的性能。
引用
@article{arxiv.2603.12837,
title = {Mask2Flow-TSE: Two-Stage Target Speaker Extraction with Masking and Flow Matching},
author = {Junwon Moon and Hyunjin Choi and Hansol Park and Heeseung Kim and Kyuhong Shim},
journal= {arXiv preprint arXiv:2603.12837},
year = {2026}
}
备注
Submitted to Interspeech 2026