中文

VorTEX:用于目标语音提取的各种重叠比例

声音 2026-03-24 v3 人工智能 计算与语言

摘要

目标语音提取 (target speech extraction, TSE) 旨在从混合信号中恢复出目标说话人的声音。虽然最近的文本提示方法显示出前景,但大多数方法假设完全重叠的混合,这限制了对现实中不同重叠比例下行为的洞察。我们介绍了 VorTEX (Various overlap ratio for Target speech EXtraction),一个以文本提示为导向的 TSE 架构,包含一种 Decoupled Adaptive Multi-branch (DAM) Fusion 块,将主要提取与辅助正则化路径分离。为实现可控分析,我们构建了 PORTE 数据集,涵盖 0% 到 100% 的重叠比例。我们进一步提出了能量抑制比 (Suppression Ratio on Energy, SuRE),这是一种诊断性指标,用于检测常规措施未捕捉的抑制行为。实验表明,现有模型在重叠情况下表现出抑制或残余干扰,而 VorTEX 在 20% 到 100% 的重叠范围内实现最高的分离保真度(例如在 20% 时为 5.50 dB,在 100% 时为 2.04 dB),同时保持零 SuRE,表明其在无抑制驱动的噪声方面具有稳健的提取能力。

关键词

引用

@article{arxiv.2603.14803,
  title  = {VorTEX: Various overlap ratio for Target speech EXtraction},
  author = {Ro-hoon Oh and Jihwan Seol and Bugeun Kim},
  journal= {arXiv preprint arXiv:2603.14803},
  year   = {2026}
}

备注

Submitted to InterSpeech 2026 (under review)