中文

设备指向性话语检测

计算与语言 2018-08-09 v1 音频与语音处理

摘要

在本工作中,我们提出一种分类器,用于在与语音助手交互的场景中区分设备指向性查询与背景语音。其应用包括拒绝错误唤醒或无意交互,以及实现无唤醒词的后继查询。考虑如下交互示例:"Computer, play music"(计算机,播放音乐),"Computer, reduce the volume"(计算机,降低音量)。在该交互中,用户需要对第二个查询重复唤醒词(Computer)。为了实现更自然的交互,设备可在首次查询后立刻重新进入监听状态(无需重复唤醒词),并将潜在后继内容作为设备指向性话语或背景语音予以接受或拒绝。所提模型由两个长短期记忆(LSTM)神经网络组成,分别训练于声学特征与自动语音识别(ASR)1-best 假设之上。随后训练一个前馈深度神经网络(DNN),将源自 LSTM 的声学嵌入与 1-best 嵌入同来自 ASR 解码器的特征相组合。实验结果表明,ASR 解码器、声学嵌入与 1-best 嵌入分别取得 9.3%、10.9% 与 20.1% 的等错误率(EER)。特征组合带来了 44% 的相对提升,最终 EER 为 5.2%。

关键词

引用

@article{arxiv.1808.02504,
  title  = {Device-directed Utterance Detection},
  author = {Sri Harish Mallidi and Roland Maas and Kyle Goehner and Ariya Rastrow and Spyros Matsoukas and Björn Hoffmeister},
  journal= {arXiv preprint arXiv:1808.02504},
  year   = {2018}
}

备注

Interspeech 2018 (accepted)