基于非因果卷积的流式 Transformer Transducer 语音识别
音频与语音处理
2021-10-12 v1 计算与语言
机器学习
摘要
本文通过使用非因果卷积改进用于语音识别的流式 transformer transducer。许多工作采用因果卷积来改进流式 transformer,忽略了前瞻上下文。我们提出使用非因果卷积分别处理中心块和前瞻上下文。该方法在卷积中利用了前瞻上下文,并保持了相似的训练和解码效率。在相似延迟下,使用带前瞻上下文的非因果卷积比因果卷积具有更好的准确率,尤其在开放域听写场景中。此外,本文采用 talking-head attention 和一种新颖的历史上下文压缩方案来进一步提升性能。talking-head attention 通过在不同头之间传递信息来改进多头自注意力。历史上下文压缩方法以紧凑方式引入更长的历史上下文。在我们的内部数据上,所提方法相对于带前瞻上下文的小型 Emformer 基线,在开放域听写、助手通用场景和助手通话场景上分别实现了相对 WERR 5.1%、14.5%、8.4% 的提升。
引用
@article{arxiv.2110.05241,
title = {Streaming Transformer Transducer Based Speech Recognition Using Non-Causal Convolution},
author = {Yangyang Shi and Chunyang Wu and Dilin Wang and Alex Xiao and Jay Mahadeokar and Xiaohui Zhang and Chunxi Liu and Ke Li and Yuan Shangguan and Varun Nagaraja and Ozlem Kalinli and Mike Seltzer},
journal= {arXiv preprint arXiv:2110.05241},
year = {2021}
}
备注
5 pages, 3 figures, submit to ICASSP 2022