一种用于多流端到端语音识别的实用两阶段训练策略
计算与语言
2019-10-24 v1 机器学习
音频与语音处理
摘要
音频处理的多流范式同时考虑多个来源,一直是信息融合的活跃研究方向。我们此前的研究在端到端自动语音识别中提供了一个有前景的方向,其中并行编码器旨在捕获多样信息,随后基于注意力机制的流级融合将不同视图结合。然而,随着流数增加导致编码器数量增加,先前方法可能需要大量内存和海量并行数据以进行联合训练。本工作中,我们提出一种实用的两阶段训练方案。阶段1训练通用特征提取器(UFE),其中编码器输出由使用全部数据训练的单流模型产生。阶段2构建多流方案,旨在仅利用 UFE 特征和阶段1的预训练组件训练注意力融合模块。实验在 DIRHA 和 AMI 两个数据集上作为多流场景进行。与我们先前方法相比,该策略实现了 8.2%–32.4% 的相对词错误率下降,同时持续优于几种常规组合方法。
引用
@article{arxiv.1910.10671,
title = {A practical two-stage training strategy for multi-stream end-to-end speech recognition},
author = {Ruizhi Li and Gregory Sell and Xiaofei Wang and Shinji Watanabe and Hynek Hermansky},
journal= {arXiv preprint arXiv:1910.10671},
year = {2019}
}
备注
submitted to ICASSP 2019