中文

MC-LExt: 具有起始提示说话人条件机制的多通道目标说话人提取

音频与语音处理 2025-10-20 v1

摘要

多通道目标说话人提取(MC-TSE)旨在从多个麦克风捕获的多说话人信号中提取目标说话人的声音。现有方法通常依赖于辅助线索,例如到达方向(DOA)或说话人嵌入。然而,基于DOA的方法依赖于明确的方向估计,并且对麦克风阵列几何形状敏感,而基于说话人嵌入的方法以隐式方式建模说话人身份,并且在嘈杂混响条件下可能会退化。为了解决这些局限性,我们提出了多通道听提取(MC-LExt),一个简单但高效的MC-TSE框架。我们的关键思想是将目标说话人的简短注册话语前置到多通道混合的每个通道中,提供一个起始提示的条件信号,可以指导TSE。这种设计允许深度神经网络(DNN)以完全端到端的方式联合学习空间和说话人身份线索。在嘈杂混响基准测试(包括WHAMR!和MC-Libri2Mix)上的实验证明了MC-TSE的有效性。

关键词

引用

@article{arxiv.2510.15437,
  title  = {MC-LExt: Multi-Channel Target Speaker Extraction with Onset-Prompted Speaker Conditioning Mechanism},
  author = {Tongtao Ling and Shulin He and Pengjie Shen and Zhong-Qiu Wang},
  journal= {arXiv preprint arXiv:2510.15437},
  year   = {2025}
}

备注

5 pages, 2 figures