中文

对话语音在线低延迟识别中的超人类表现

计算机视觉与模式识别 2021-07-28 v5

摘要

实现识别人类语音的超人类表现数十年来一直是目标,研究者致力于日益困难的任务。1990 年代发现,两人间对话语音比朗读语音困难得多,因为犹豫、不流畅、错误开头与随意发音使声学处理复杂化,并要求联合稳健处理声学、词汇与语言上下文。基于统计模型的早期尝试仅能达到 50% 以上的错误率,远逊人类表现(WER 约 5.5%)。神经混合模型与近期基于注意力的编码器-解码器模型已显著改善表现,因这类上下文现可以整体方式学习。然而,处理此类上下文需要整句语音呈现,从而在输出识别结果前引入不期望的延迟。本文中我们同时关注表现与延迟。我们给出一个系统的结果,该系统能在仅落后说话人语音 1 秒的基于词的延迟下,取得超人类表现(在 Switchboard 对话基准上 WER 为 5.0%)。该系统使用集成于一种新颖低延迟增量推断方法中的多个基于注意力的编码器-解码器网络。

关键词

引用

@article{arxiv.2010.03449,
  title  = {Super-Human Performance in Online Low-latency Recognition of Conversational Speech},
  author = {Thai-Son Nguyen and Sebastian Stueker and Alex Waibel},
  journal= {arXiv preprint arXiv:2010.03449},
  year   = {2021}
}

备注

To appear in Interspeech 2021