中文

双耳角度分离网络

音频与语音处理 2024-01-18 v1 机器学习 声音

摘要

我们提出了一种神经网络模型,该模型能够使用两个麦克风,将目标语音源与来自不同角度区域的干扰源分离开来。该模型使用全向麦克风的模拟房间脉冲响应(RIRs)进行训练,无需收集真实的RIRs。通过依赖特定的角度区域和多个房间模拟,该模型利用一致的到达时间差(TDOA)线索(我们称之为延迟对比),来分离目标和干扰源,同时在各种混响环境中保持鲁棒性。我们证明,该模型不仅能泛化到麦克风几何形状略有不同的商用设备上,而且性能优于我们之前在同一设备上使用一个额外麦克风的工作。该模型可在设备上实时运行,适用于电话和视频会议等低延迟流式应用。

关键词

引用

@article{arxiv.2401.08864,
  title  = {Binaural Angular Separation Network},
  author = {Yang Yang and George Sung and Shao-Fu Shih and Hakan Erdogan and Chehung Lee and Matthias Grundmann},
  journal= {arXiv preprint arXiv:2401.08864},
  year   = {2024}
}

备注

Accepted to ICASSP 2024