中文

用于设备指向性话语检测的带因果均值聚合的流式 ResLSTM

音频与语音处理 2020-07-21 v1 声音

摘要

在本文中,我们提出一种流式模型,以区分面向智能家居设备的语音查询与背景语音。所提模型由多个带残差连接的 CNN 层以及随后的堆叠 LSTM 架构组成。流式能力通过使用单向 LSTM 层与因果均值聚合层来实现,以形成截至当前帧的最终话语级预测。为避免在线流式推理中的冗余计算,我们对每个卷积操作使用缓存机制。在设备指向与非设备指向任务上的实验结果表明,与我们先前在此任务上的最佳模型相比,所提模型取得了 41% 的等错误率降低。此外,我们表明所提模型能够比基于注意力的模型更早地准确预测。

关键词

引用

@article{arxiv.2007.09245,
  title  = {Streaming ResLSTM with Causal Mean Aggregation for Device-Directed Utterance Detection},
  author = {Xiaosu Tong and Che-Wei Huang and Sri Harish Mallidi and Shaun Joseph and Sonal Pareek and Chander Chandak and Ariya Rastrow and Roland Maas},
  journal= {arXiv preprint arXiv:2007.09245},
  year   = {2020}
}