中文

FaSNet:面向多麦克风音频处理的低延迟自适应波束成形

音频与语音处理 2019-10-02 v2 机器学习 声音 信号处理

摘要

波束成形已被广泛研究用于多通道音频处理任务。近来,基于学习的波束成形方法(有时称为神经波束成形器)在信号质量(如信噪比(SNR))和语音识别(如词错误率(WER))方面均取得了显著改进。此类系统通常是非因果的,并且需要大上下文以鲁棒估计通道间特征,这在需要低延迟响应的应用中不切实际。本文中,我们提出滤波求和网络(FaSNet),一种适用于低延迟场景的时域、基于滤波器的波束成形方法。FaSNet采用两阶段系统设计:首先为选定参考通道学习帧级时域自适应波束成形滤波器,然后计算所有其余通道的滤波器。所有通道的滤波输出求和生成最终输出。实验表明,尽管模型规模小,FaSNet在混响语音增强与分离任务中相对于尺度不变信噪比(SI-SNR)能够超越若干传统oracle波束成形器。此外,当在CHiME-3数据集上采用频域目标函数训练时,FaSNet相比基线模型实现了14.3%的相对词错误率降低(RWERR)。这些结果显示了FaSNet尤其在混响和噪声信号条件下的有效性。

关键词

引用

@article{arxiv.1909.13387,
  title  = {FaSNet: Low-latency Adaptive Beamforming for Multi-microphone Audio Processing},
  author = {Yi Luo and Enea Ceolini and Cong Han and Shih-Chii Liu and Nima Mesgarani},
  journal= {arXiv preprint arXiv:1909.13387},
  year   = {2019}
}

备注

Accepted to ASRU 2019