中文

基于时间偏移上下文注意力与动态右侧上下文遮蔽的流式语音识别提升

声音 2025-02-24 v1 音频与语音处理

摘要

基于块的推理是开发实时流式语音识别的热门方法,因其简单高效。然而,由于其仅关注历史和当前块的上下文,在需要考虑未来上下文的场景中可能导致性能下降。针对此问题,我们提出一种新方法,融合时间偏移上下文注意力(TSCA)和动态右侧上下文遮蔽(DRC)。我们的方法在Librispeech数据集上采用包含TSCA提供的上下文未来信息后,实现了10%至13.9%的相对词错误率降低。此外,我们提出一种流式自动语音识别管道,支持TSCA的集成,用户感知的延迟最小,同时也具备批处理能力,具有广泛的实际应用价值。

关键词

引用

@article{arxiv.2502.15158,
  title  = {Improving Streaming Speech Recognition With Time-Shifted Contextual Attention And Dynamic Right Context Masking},
  author = {Khanh Le and Duc Chau},
  journal= {arXiv preprint arXiv:2502.15158},
  year   = {2025}
}

备注

INTERSPEECH 2024