基于 BLSTM 二值掩码的兴趣声源轻量级在线分离
音频与语音处理
2020-08-21 v2
摘要
在线音频源分离一直是听觉场景分析与机器人听觉的重要组成部分。由于其在线能力,实现这一目标的主要技术一直是空间滤波(或波束成形),其中假设兴趣声源(SOI)的位置(主要是到达方向;DOA)已知。然而,这些技术在最终结果中存在显著的干扰泄漏。在本文中,我们提出一种两步技术:1)基于相位的波束成形器,除估计 SOI 外,还提供累积环境干扰的估计;2)基于 BLSTM 的时频二值掩码阶段,计算旨在将 SOI 从累积环境干扰中分离的二值掩码。在我们的测试中,该技术在模拟数据下提供高于 20 dB 的信干比(SIR)。由于波束成形器输出的性质,标签置换问题从一开始就被处理。这使得所提方案成为一种轻量级替代方案,与当前基于深度学习的技术相比,所需计算资源显著更少(几乎少一个数量级),同时提供相当的 SIR 性能。
引用
@article{arxiv.2002.11241,
title = {Lightweight Online Separation of the Sound Source of Interest through BLSTM-Based Binary Masking},
author = {Alejandro Maldonado and Caleb Rascon and Ivette Velez},
journal= {arXiv preprint arXiv:2002.11241},
year = {2020}
}
备注
Accepted for publication in Computaci\'on y Sistemas