双耳角度分离网络
音频与语音处理
2024-01-18 v1 机器学习
声音
摘要
我们提出了一种神经网络模型,该模型能够使用两个麦克风,将目标语音源与来自不同角度区域的干扰源分离开来。该模型使用全向麦克风的模拟房间脉冲响应(RIRs)进行训练,无需收集真实的RIRs。通过依赖特定的角度区域和多个房间模拟,该模型利用一致的到达时间差(TDOA)线索(我们称之为延迟对比),来分离目标和干扰源,同时在各种混响环境中保持鲁棒性。我们证明,该模型不仅能泛化到麦克风几何形状略有不同的商用设备上,而且性能优于我们之前在同一设备上使用一个额外麦克风的工作。该模型可在设备上实时运行,适用于电话和视频会议等低延迟流式应用。
引用
@article{arxiv.2401.08864,
title = {Binaural Angular Separation Network},
author = {Yang Yang and George Sung and Shao-Fu Shih and Hakan Erdogan and Chehung Lee and Matthias Grundmann},
journal= {arXiv preprint arXiv:2401.08864},
year = {2024}
}
备注
Accepted to ICASSP 2024