中文

基于 BLSTM 二值掩码的兴趣声源轻量级在线分离

音频与语音处理 2020-08-21 v2

摘要

在线音频源分离一直是听觉场景分析与机器人听觉的重要组成部分。由于其在线能力,实现这一目标的主要技术一直是空间滤波(或波束成形),其中假设兴趣声源(SOI)的位置(主要是到达方向;DOA)已知。然而,这些技术在最终结果中存在显著的干扰泄漏。在本文中,我们提出一种两步技术:1)基于相位的波束成形器,除估计 SOI 外,还提供累积环境干扰的估计;2)基于 BLSTM 的时频二值掩码阶段,计算旨在将 SOI 从累积环境干扰中分离的二值掩码。在我们的测试中,该技术在模拟数据下提供高于 20 dB 的信干比(SIR)。由于波束成形器输出的性质,标签置换问题从一开始就被处理。这使得所提方案成为一种轻量级替代方案,与当前基于深度学习的技术相比,所需计算资源显著更少(几乎少一个数量级),同时提供相当的 SIR 性能。

关键词

引用

@article{arxiv.2002.11241,
  title  = {Lightweight Online Separation of the Sound Source of Interest through BLSTM-Based Binary Masking},
  author = {Alejandro Maldonado and Caleb Rascon and Ivette Velez},
  journal= {arXiv preprint arXiv:2002.11241},
  year   = {2020}
}

备注

Accepted for publication in Computaci\'on y Sistemas