中文

面向多通道自动语音识别的说话人自适应波束成形

计算与语言 2018-06-21 v1 声音 音频与语音处理

摘要

本文在多通道 ASR 背景下,提出一种将基于掩码的统计最优波束成形方法适配到感兴趣说话人的方法。统计最优波束形成器的波束成形向量通过利用由神经网络估计的语音与噪声掩码来计算。所提出的自适应方法基于将波束形成器(包括掩码估计网络)与 ASR 系统的声学模型相集成。这使得训练误差能从声学建模代价函数一路通过波束成形操作及掩码估计网络反向传播。通过使用第一遍识别结果并保持所有其他参数固定,掩码估计网络因此可通过再训练进行微调。感兴趣说话人的语句从而可用于两遍方法,以针对该特定说话人的语音特征优化波束成形。结果表明,该方法在 CHiME-4 数据上改善了最先进多通道 ASR 系统的性能。此外,讨论了自适应对估计语音掩码的影响。

关键词

引用

@article{arxiv.1806.07407,
  title  = {Speaker Adapted Beamforming for Multi-Channel Automatic Speech Recognition},
  author = {Tobias Menne and Ralf Schlüter and Hermann Ney},
  journal= {arXiv preprint arXiv:1806.07407},
  year   = {2018}
}

备注

submitted to IEEE SLT 2018