用于设备指向性话语检测的带因果均值聚合的流式 ResLSTM
音频与语音处理
2020-07-21 v1 声音
摘要
在本文中,我们提出一种流式模型,以区分面向智能家居设备的语音查询与背景语音。所提模型由多个带残差连接的 CNN 层以及随后的堆叠 LSTM 架构组成。流式能力通过使用单向 LSTM 层与因果均值聚合层来实现,以形成截至当前帧的最终话语级预测。为避免在线流式推理中的冗余计算,我们对每个卷积操作使用缓存机制。在设备指向与非设备指向任务上的实验结果表明,与我们先前在此任务上的最佳模型相比,所提模型取得了 41% 的等错误率降低。此外,我们表明所提模型能够比基于注意力的模型更早地准确预测。
引用
@article{arxiv.2007.09245,
title = {Streaming ResLSTM with Causal Mean Aggregation for Device-Directed Utterance Detection},
author = {Xiaosu Tong and Che-Wei Huang and Sri Harish Mallidi and Shaun Joseph and Sonal Pareek and Chander Chandak and Ariya Rastrow and Roland Maas},
journal= {arXiv preprint arXiv:2007.09245},
year = {2020}
}