中文

深度语音关键词 spotting: 综述

声音 2021-11-23 v1 人机交互 机器学习 音频与语音处理

摘要

语音关键词 spotting(KWS)致力于从音频流中识别关键词,得益于几年前深度学习引入的范式转变,已成为一项快速增长的技术。这使得深度KWS得以迅速嵌入各类小型电子设备中,用于激活语音助手等不同用途。前景表明该技术的社会应用将持续增长。因此,深度KWS成为语音科学家们的热门研究课题并不令人意外,他们不断寻求KWS性能提升与计算复杂度降低。此背景催生了本文,我们对深度语音KWS进行文献综述,以协助关注该技术的从业者与研究者。具体而言,本综述具有全面性,涵盖对深度KWS系统(包括语音特征、声学建模与后验处理)、鲁棒性方法、应用、数据集、评估指标、深度KWS系统性能及音视频KWS的透彻分析。本文的分析使我们识别出若干未来研究方向,包括借鉴自动语音识别研究的方向以及专属于语音KWS问题的方向。

关键词

引用

@article{arxiv.2111.10592,
  title  = {Deep Spoken Keyword Spotting: An Overview},
  author = {Iván López-Espejo and Zheng-Hua Tan and John Hansen and Jesper Jensen},
  journal= {arXiv preprint arXiv:2111.10592},
  year   = {2021}
}