中文

基于双耳选择性注意力模型的目标说话人提取

音频与语音处理 2024-06-19 v1 声音 信号处理

摘要

人类在鸡尾酒局场景中选择性聚焦于目标说话人的惊人能力得益于双耳音频处理。在本文中,我们提出了基于 Filter-and-Sum Network (FaSNet) 的双耳时域目标说话人提取模型。鼓励人类选择性听觉,我们的模型在分离器中引入目标说话人嵌入,使用基于多头注意力的选择性注意力块。我们还比较了两种双耳交互方法——时域信号的余弦相似度和在学习的谱表示中的跨声道相关性。我们的实验结果表明,我们的模型优于单声道配置和最先进的多通道目标说话人提取模型,在室温无反射双说话人测试配置下实现最佳性能,分别达到18.52 dB SI-SDR、19.12 dB SDR 和 3.05 PESQ 分数。

关键词

引用

@article{arxiv.2406.12236,
  title  = {Binaural Selective Attention Model for Target Speaker Extraction},
  author = {Hanyu Meng and Qiquan Zhang and Xiangyu Zhang and Vidhyasaharan Sethu and Eliathamby Ambikairajah},
  journal= {arXiv preprint arXiv:2406.12236},
  year   = {2024}
}

备注

Accepted by INTERSPEECH2024