中文

面向多说话者关键词检测的文本感知语音分离

音频与语音处理 2024-06-19 v1

摘要

在噪声环境中,确保 keyword spotting(KWS)系统的鲁棒性至关重要。尽管大量研究聚焦于噪声 KWS,但针对 multi-talker 混合语音场景的关注仍不足。与通常使用说话者线索进行 multi-talker speech 分离的鸡尾酒问题不同,关键挑战在于基于文本线索提取目标语音以进行 KWS。为此,本文提出一种 novel Text-aware Permutation Determinization Training 方法,用于 multi-talker KWS,结合 clue-based Speech Separation 前端(TPDT-SS)。我们的研究突显了 SS 前端的 critical role,表明将 keyword-specific 线索纳入这些 model 可以显著提升 effectiveness。TPDT-SS 在解决混合 keyword speech 中的 permutation 问题方面取得了显著成效,从而大幅提升了 backend 的 performance。此外,对 system 在未见混合语音上的 fine-tuning 进一步提升了 performance。

关键词

引用

@article{arxiv.2406.12447,
  title  = {Text-aware Speech Separation for Multi-talker Keyword Spotting},
  author = {Haoyu Li and Baochen Yang and Yu Xi and Linfeng Yu and Tian Tan and Hao Li and Kai Yu},
  journal= {arXiv preprint arXiv:2406.12447},
  year   = {2024}
}

备注

Accepted by INTERSPEECH2024