中文

面向快速高效语音系统的统一端到端语音识别与端点检测

声音 2023-02-16 v1 计算与语言 音频与语音处理

摘要

自动语音识别(ASR)系统通常依赖外部的端点检测(EP)模型来识别语音边界。在这项工作中,我们提出一种方法,在单一的端到端(E2E)多任务模型中联合训练 ASR 和 EP 任务,通过可选地利用于 ASR 音频编码器的信息来提升 EP 质量。我们引入了一种“开关”连接,它训练 EP 直接消费音频帧或来自 ASR 模型的低层潜在表示。这产生了一个单一的 E2E 模型,在推理时可用于以低成本进行帧过滤,并基于进行中的 ASR 计算做出高质量的查询结束(EOQ)预测。我们在一个语音搜索测试集上展示的结果表明,与独立的单任务模型相比,该方法将中位端点延迟降低了 120 毫秒(降低 30.8%),并将 90 分位延迟降低了 170 毫秒(降低 23.0%),且不使词错误率退化。对于连续识别,WER 相对提升了 10.6%。

关键词

引用

@article{arxiv.2211.00786,
  title  = {Unified End-to-End Speech Recognition and Endpointing for Fast and Efficient Speech Systems},
  author = {Shaan Bijwadia and Shuo-yiin Chang and Bo Li and Tara Sainath and Chao Zhang and Yanzhang He},
  journal= {arXiv preprint arXiv:2211.00786},
  year   = {2023}
}

备注

To be published in Spoken Language Technology Workshop (SLT) 2022