中文

CUSIDE-array:一种基于实际评估的流式多通道端到端语音识别系统

音频与语音处理 2024-09-18 v2

摘要

最近涌现出多通道端到端(ME2E)ASR 系统。尽管流式单通道端到端 ASR 已被广泛研究,但流式 ME2E ASR 的探索仍有限。此外,近期研究关注分布内(ID)和分布外(OOD)测试之间的差距并进行实际评估。本文聚焦两个研究问题:实现流式 ME2E ASR 和提高 OOD 泛化能力。我们提出 CUSIDE-array 方法,将最新的 CUSIDE methodology(Chunking、Simulating Future Context 和 Decoding)集成到 ME2E ASR 的神经束阵列方法中。它使前端和后端的流式处理成为可能,总延迟为 402ms。CUSIDE-array ME2E 模型在 ID 和 OOD 测试中均显示出优异的流式性能。实际评估确认了 CUSIDE-array 在通过后端预训练和 ME2E 微调来利用单通道数据提高 OOD 泛化能力方面的优势。

关键词

引用

@article{arxiv.2407.09807,
  title  = {CUSIDE-array: A Streaming Multi-Channel End-to-End Speech Recognition System with Realistic Evaluations},
  author = {Xiangzhu Kong and Tianqi Ning and Hao Huang and Zhijian Ou},
  journal= {arXiv preprint arXiv:2407.09807},
  year   = {2024}
}

备注

Accepted into ISCSLP 2024