中文

鸡尾酒会中靠打字聆听:文本引导的目标说话人提取

音频与语音处理 2024-10-08 v4 计算与语言

摘要

人类能够轻松地从复杂声学环境中分离出单个说话人,这一能力被称为“鸡尾酒会效应”。然而,在目标说话人提取(TSE)领域,复现该能力一直是一项重大挑战。传统 TSE 方法主要依赖声纹,这引发了隐私担忧,并面临注册样本质量与可用性问题以及说话人内部差异问题。为解决这些问题,本文提出一种名为 LLM-TSE 的新型文本引导 TSE 范式。在该范式中,先进的大语言模型 LLaMA 2 处理用户键入的文本输入以提取语义线索。我们证明,仅文本描述即可有效作为提取线索,从而解决隐私担忧并降低对声纹的依赖。此外,我们的方法具有灵活性,允许用户指定提取或抑制某说话人,并通过融入上下文相关文本信息增强对说话人内部差异的鲁棒性。实验结果表明,仅使用基于文本的线索即具竞争力,并证明了将文本用作任务选择器的有效性。此外,将基于文本的线索与预注册线索结合时,其达到了新的 SOTA。本工作首次将 LLM 与 TSE 集成,有望为解决鸡尾酒会问题建立新基准,并通过提供通用且注重隐私的解决方案拓展 TSE 应用范围。

关键词

引用

@article{arxiv.2310.07284,
  title  = {Typing to Listen at the Cocktail Party: Text-Guided Target Speaker Extraction},
  author = {Xiang Hao and Jibin Wu and Jianwei Yu and Chenglin Xu and Kay Chen Tan},
  journal= {arXiv preprint arXiv:2310.07284},
  year   = {2024}
}

备注

Under review, https://github.com/haoxiangsnr/llm-tse