中文

检测、关注与提取:关键词引导的目标说话人提取

音频与语音处理 2026-02-10 v1

摘要

目标说话人提取(TSE)旨在从包含多个竞争说话人的混合语音中提取目标说话人的语音。传统的 TSE 系统主要依赖说话人线索(例如预注册的语音)来识别和分离目标说话人。然而,在许多实际场景中,无法获得干净的注册语音,这限制了现有方法的适用性。在本工作中,我们提出了 DAE-TSE,一个关键词引导的 TSE 框架,通过目标说话人发出的特定关键词来指定目标说话人。通过利用关键词(即部分转录)作为线索,我们的方法为基于注册的 TSE 提供了一种灵活且实用的替代方案。DAE-TSE 遵循检测-关注-提取(DAE)范式:它首先检测给定关键词的存在,然后根据关键词内容关注相应的说话人,最后提取目标语音。实验结果表明,DAE-TSE 优于依赖干净注册语音的标准 TSE 系统。据我们所知,这是首次利用部分转录作为线索在 TSE 中指定目标说话人的研究,为实际场景提供了一种灵活且实用的解决方案。我们的代码和演示页面现已公开。

关键词

引用

@article{arxiv.2602.07977,
  title  = {Detect, Attend and Extract: Keyword Guided Target Speaker Extraction},
  author = {Haoyu Li and Yu Xi and Yidi Jiang and Shuai Wang and Kate Knill and Mark Gales and Haizhou Li and Kai Yu},
  journal= {arXiv preprint arXiv:2602.07977},
  year   = {2026}
}

备注

4 figures, 4 tables. Submitted to IJCAI-ECAI 2026