CUSIDE:用于流式ASR的分块、模拟未来上下文与解码
音频与语音处理
2022-08-03 v2 计算与语言
摘要
已知历史与未来上下文信息对准确的声学建模十分重要。然而,获取未来上下文会给流式ASR带来延迟。本文提出一种新框架——分块、模拟未来上下文与解码(CUSIDE)用于流式语音识别。引入一新模拟模块递归地模拟未来上下文帧,而无需等待未来上下文。该模拟模块与ASR模型通过自监督损失联合训练;ASR模型以常规ASR损失优化,如我们实验中使用的CTC-CRF。实验表明,相较于使用真实未来帧作为右上下文,使用模拟未来上下文可在保持识别精度的同时大幅降低延迟。借助CUSIDE,我们在AISHELL-1数据集上取得了新的最先进流式ASR结果。
引用
@article{arxiv.2203.16758,
title = {CUSIDE: Chunking, Simulating Future Context and Decoding for Streaming ASR},
author = {Keyu An and Huahuan Zheng and Zhijian Ou and Hongyu Xiang and Ke Ding and Guanglu Wan},
journal= {arXiv preprint arXiv:2203.16758},
year = {2022}
}
备注
Accepted into INTERSPEECH 2022