中文

用于音频流异常事件检测的集成式中文端到端口语理解

多媒体 2021-12-14 v2 机器学习 音频与语音处理

摘要

传统口语理解(SLU)包含两阶段,第一阶段通过自动语音识别(ASR)将语音映射为文本,第二阶段通过自然语言理解(NLU)将文本映射为意图。端到端 SLU 通过单一深度学习模型将语音直接映射为意图。由于缺少大规模中文 SLU 数据集,以往的端到端 SLU 模型主要用于英文环境,且仅使用一种 ASR 模型从语音中提取特征。在快手技术的协助下,我们收集了一个大规模中文 SLU 数据集,用于检测其直播音频流中的异常事件。基于该数据集,本文提出了一种用于中文环境的集成式端到端 SLU 模型。该集成 SLU 模型利用多个预训练 ASR 模型提取层次化特征,从而更好地表征音素级与词级信息。所提方法相较以往端到端 SLU 模型准确率提升了 9.7%。

关键词

引用

@article{arxiv.2010.09235,
  title  = {Ensemble Chinese End-to-End Spoken Language Understanding for Abnormal Event Detection from audio stream},
  author = {Haoran Wei and Fei Tao and Runze Su and Sen Yang and Ji Liu},
  journal= {arXiv preprint arXiv:2010.09235},
  year   = {2021}
}

备注

Submitting to ICASSP 2021