AlphaFlowTSE:基于条件 AlphaFlow 的一步生成目标说话人提取
声音
2026-03-12 v1 人工智能
摘要
在目标说话人提取 (TSE) 中,我们旨在使用短 enrollment 语句作为参考,从多说话人混合信号中恢复目标语音。近期研究在扩散和流匹配生成器方面取得了对目标语音保真度的提升。然而,多步骤采样会增加延迟,而一步解决方案往往依赖于混合相关的时间坐标,这在现实世界的对话中可能不可靠。我们提出 AlphaFlowTSE,一种基于无 Jacobian 向量积 (JVP) 的 AlphaFlow 目标训练的一步条件生成模型。AlphaFlowTSE 学习从观察到的混合信号开始的混合到目标轨迹的平均速度运输,消除了辅助混合比例预测,并通过结合流匹配与区间一致性教师学生目标来稳定训练。在 Libri2Mix 和 REAL-T 上的实验表明,AlphaFlowTSE 在目标说话人相似性和实验混合泛化方面优于下游自动语音识别 (ASR) 的现有方法。
引用
@article{arxiv.2603.10701,
title = {AlphaFlowTSE: One-Step Generative Target Speaker Extraction via Conditional AlphaFlow},
author = {Duojia Li and Shuhan Zhang and Zihan Qian and Wenxuan Wu and Shuai Wang and Qingyang Hong and Lin Li and Haizhou Li},
journal= {arXiv preprint arXiv:2603.10701},
year = {2026}
}
备注
Submitted to Interspeech 2026 for review