用于远场语音识别的麦克风排序学习
音频与语音处理
2021-04-15 v2 机器学习
声音
信号处理
摘要
充分挖掘自组织麦克风网络用于远场语音识别仍是一个开放问题。经验证据表明,能够选择最佳麦克风可在无需前端处理额外开销的情况下带来识别性能的显著提升。当前的信道选择技术要么依赖基于信号、解码器或后验的特征。基于信号的特征计算代价低,但并不总与识别性能相关。相反,基于解码器和后验的特征表现出更好的相关性,却需要大量计算资源。在本工作中,我们通过提出 MicRank 来解决信道选择问题,这是一个排序学习框架,其中神经网络被训练以利用训练集上的识别性能对可用信道进行排序。所提方法对阵列几何结构与识别后端类型无关。我们使用专门开发的合成数据集与 CHiME-6 数据研究了不同的排序学习策略。结果表明,所提方法能够大幅超越先前的选择技术,达到可与基于预言信号的度量相媲美、且在某些情形下更优的性能。
引用
@article{arxiv.2104.02819,
title = {Learning to Rank Microphones for Distant Speech Recognition},
author = {Samuele Cornell and Alessio Brutti and Marco Matassoni and Stefano Squartini},
journal= {arXiv preprint arXiv:2104.02819},
year = {2021}
}