中文

基于 Scaling Sparsemax 的大规模自组织麦克风阵列语音识别信道选择

音频与语音处理 2022-02-15 v3 机器学习 声音

摘要

近年来,自组织麦克风阵列的语音识别受到广泛关注。已知信道选择是自组织麦克风阵列的一个重要问题,然而该课题在语音识别中似乎远未被充分探索,尤其是针对大规模自组织麦克风阵列。为解决此问题,我们提出一种 Scaling Sparsemax 算法,用于大规模自组织麦克风阵列语音识别的信道选择问题。具体而言,我们首先将多通道端到端语音识别系统流注意力机制中的常规 Softmax 算子替换为 Sparsemax,其通过将噪声信道的信道权重置零来进行信道选择。由于 Sparsemax 将许多信道权重严苛地惩罚为零,我们提出 Scaling Sparsemax,其仅将极噪信道的权重置零,从而温和地惩罚信道。在 conformer 语音识别架构下,使用超过 30 通道的自组织麦克风阵列的实验结果表明,在信道数匹配与不匹配的测试场景中,所提 Scaling Sparsemax 在仿真数据集上比 Softmax 的词错率低逾 30%,在半真实数据集上低逾 20%。

关键词

引用

@article{arxiv.2103.15305,
  title  = {Scaling sparsemax based channel selection for speech recognition with ad-hoc microphone arrays},
  author = {Junqi Chen and Xiao-Lei Zhang},
  journal= {arXiv preprint arXiv:2103.15305},
  year   = {2022}
}