中文

CaTT-KWS:基于级联 Transducer-Transformer 的多阶段定制化关键词 spotting 框架

声音 2022-07-05 v1 音频与语音处理

摘要

定制化关键词 spotting(KWS)在边缘设备上部署以实现免提用户体验方面具有巨大潜力。然而,在实际应用中,误唤醒(FA)对于 spotting 数十甚至数百个关键词而言将是一个严重问题,极大影响用户体验。为解决该问题,本文利用近期基于 transducer 和 transformer 的声学模型进展,提出了一种名为级联 Transducer-Transformer KWS(CaTT-KWS)的新多阶段定制化 KWS 框架,其包含一个基于 transducer 的关键词检测器、一个基于帧级音素预测器的强制对齐模块以及一个基于 transformer 的解码器。具体而言,流式 transducer 模块用于在音频流中 spotting 关键词候选;随后利用音素预测器预测的音素后验概率实施强制对齐,完成第一阶段关键词验证并细化关键词时间边界;最后,transformer 解码器进一步验证被触发的关键词。我们提出的 CaTT-KWS 框架在不明显损害关键词识别精度的前提下有效降低了 FA 率。具体而言,在一个具有挑战性的数据集上我们可达到每小时仅 0.13 次 FA,相较基于 transducer 的检测模型 FA 相对降低超过 90%,而关键词识别精度仅下降不到 2%。

关键词

引用

@article{arxiv.2207.01267,
  title  = {CaTT-KWS: A Multi-stage Customized Keyword Spotting Framework based on Cascaded Transducer-Transformer},
  author = {Zhanheng Yang and Sining Sun and Jin Li and Xiaoming Zhang and Xiong Wang and Long Ma and Lei Xie},
  journal= {arXiv preprint arXiv:2207.01267},
  year   = {2022}
}

备注

Accepted by Interspeech 2022