用于语音识别的上下文感知 Transformer Transducer
计算与语言
2021-11-08 v1 机器学习
声音
音频与语音处理
摘要
端到端(E2E)自动语音识别(ASR)系统常难以识别训练数据中罕见的不常见词。一种有前景的方法是在推理时利用个性化/上下文信息以提高此类罕见词的识别准确率。本工作中,我们提出一种新颖的上下文感知 Transformer Transducer(CATT)网络,其通过利用此类上下文信号改进了基于 transformer 的 ASR 系统的当前最优水平。具体地,我们提出一个基于多头注意力的上下文偏置网络,其与 ASR 其余子网络联合训练。我们探索了编码上下文数据与生成最终注意力上下文向量的不同技术。我们还利用 BLSTM 与预训练 BERT 基于的模型来编码上下文数据并引导网络训练。使用内部远场数据集,我们表明采用基于 BERT 的上下文编码器的 CATT 将基线 transformer transducer 的词错误率分别降低了 24.2% 与 19.4%,并优于现有深度上下文模型。
引用
@article{arxiv.2111.03250,
title = {Context-Aware Transformer Transducer for Speech Recognition},
author = {Feng-Ju Chang and Jing Liu and Martin Radfar and Athanasios Mouchtaris and Maurizio Omologo and Ariya Rastrow and Siegfried Kunzmann},
journal= {arXiv preprint arXiv:2111.03250},
year = {2021}
}
备注
Accepted to ASRU 2021