CUSIDE-array:一种基于实际评估的流式多通道端到端语音识别系统
音频与语音处理
2024-09-18 v2
摘要
最近涌现出多通道端到端(ME2E)ASR 系统。尽管流式单通道端到端 ASR 已被广泛研究,但流式 ME2E ASR 的探索仍有限。此外,近期研究关注分布内(ID)和分布外(OOD)测试之间的差距并进行实际评估。本文聚焦两个研究问题:实现流式 ME2E ASR 和提高 OOD 泛化能力。我们提出 CUSIDE-array 方法,将最新的 CUSIDE methodology(Chunking、Simulating Future Context 和 Decoding)集成到 ME2E ASR 的神经束阵列方法中。它使前端和后端的流式处理成为可能,总延迟为 402ms。CUSIDE-array ME2E 模型在 ID 和 OOD 测试中均显示出优异的流式性能。实际评估确认了 CUSIDE-array 在通过后端预训练和 ME2E 微调来利用单通道数据提高 OOD 泛化能力方面的优势。
引用
@article{arxiv.2407.09807,
title = {CUSIDE-array: A Streaming Multi-Channel End-to-End Speech Recognition System with Realistic Evaluations},
author = {Xiangzhu Kong and Tianqi Ning and Hao Huang and Zhijian Ou},
journal= {arXiv preprint arXiv:2407.09807},
year = {2024}
}
备注
Accepted into ISCSLP 2024