中文

基于半监督学习的全可学习多通道声学建模前端

声音 2020-05-05 v1 机器学习 音频与语音处理

摘要

本文中,我们研究了教师-学生训练范式以训练用于远场自动语音识别(ASR)的全可学习多通道声学模型。利用在波束成形音频上训练的大型离线教师模型,我们训练了语音识别系统中使用的更简单的多通道学生声学模型。对于学生模型,多通道特征提取层与高层分类层均使用教师模型的对数几率(logits)进行联合训练。在我们的实验中,与在约 600 小时转写数据上训练的基线模型相比,使用额外 1800 小时未转写数据时实现了约 27.3% 的相对词错误率(WER)降低。我们还研究了使用 L2 损失预训练多通道前端以输出波束成形对数梅尔滤波器组能量(LFBE)的益处。我们发现,与直接使用波束形成器和梅尔滤波器组系数初始化前端的多通道模型相比,预训练使词错误率改善了 10.7%。最后,预训练与教师-学生训练相结合相比基线实现了 31% 的 WER 降低。

关键词

引用

@article{arxiv.2002.00125,
  title  = {Fully Learnable Front-End for Multi-Channel Acoustic Modeling using Semi-Supervised Learning},
  author = {Sanna Wager and Aparna Khare and Minhua Wu and Kenichi Kumatani and Shiva Sundaram},
  journal= {arXiv preprint arXiv:2002.00125},
  year   = {2020}
}

备注

To appear in ICASSP 2020