中文

Mask2Flow-TSE:基于掩码和流匹配的双阶段目标说话人提取

声音 2026-03-16 v1 人工智能

摘要

目标说话人提取(TSE)从重叠语音混合信号中提取给定参考语音的目标说话人声线。现有方法通常分为两类:判别式和生成式。判别式方法应用时频掩码实现快速推断,但常过抑制目标信号;生成式方法则以大量迭代步骤合成高质量语音。我们提出Mask2Flow-TSE,一个双阶段框架,结合两类方法的优势。第一阶段应用判别式掩码进行粗分割,第二阶段采用流匹配对输出进行细化,逼近目标语音。不同于从高斯噪声合成语音的方法,本方法从掩码时频谱开始,实现单步推断的高质量重构。实验表明,Mask2Flow-TSE在约850万参数下,达到与现有生成式TSE方法相当的性能。

关键词

引用

@article{arxiv.2603.12837,
  title  = {Mask2Flow-TSE: Two-Stage Target Speaker Extraction with Masking and Flow Matching},
  author = {Junwon Moon and Hyunjin Choi and Hansol Park and Heeseung Kim and Kyuhong Shim},
  journal= {arXiv preprint arXiv:2603.12837},
  year   = {2026}
}

备注

Submitted to Interspeech 2026