中文

通过直接利用时频域中的上下文信息进行目标说话人提取

音频与语音处理 2024-02-28 v1

摘要

在目标说话人提取中,许多研究依赖于从目标说话人注册中获取并用作指导的说话人嵌入。然而,仅使用说话人嵌入可能无法充分利用注册中包含的上下文信息。在本文中,我们直接在时频(T-F)域中利用这种上下文信息。具体而言,注册信号和混合信号的 T-F 表示通过注意力机制进行交互,以计算加权矩阵。这些加权矩阵反映了 T-F 表示不同帧之间的相似性,并进一步用于获得注册信号的一致性 T-F 表示。这些一致性表示作为指导,允许更好地利用上下文信息。此外,所提出的方法在基准数据集上实现了最先进(SOTA)的性能,并展示了其在复杂场景中的有效性。

关键词

引用

@article{arxiv.2402.17146,
  title  = {Target Speaker Extraction by Directly Exploiting Contextual Information in the Time-Frequency Domain},
  author = {Xue Yang and Changchun Bao and Jing Zhou and Xianhong Chen},
  journal= {arXiv preprint arXiv:2402.17146},
  year   = {2024}
}

备注

Accepted by ICASSP 2024