设备指向性话语检测
计算与语言
2018-08-09 v1 音频与语音处理
摘要
在本工作中,我们提出一种分类器,用于在与语音助手交互的场景中区分设备指向性查询与背景语音。其应用包括拒绝错误唤醒或无意交互,以及实现无唤醒词的后继查询。考虑如下交互示例:"Computer, play music"(计算机,播放音乐),"Computer, reduce the volume"(计算机,降低音量)。在该交互中,用户需要对第二个查询重复唤醒词(Computer)。为了实现更自然的交互,设备可在首次查询后立刻重新进入监听状态(无需重复唤醒词),并将潜在后继内容作为设备指向性话语或背景语音予以接受或拒绝。所提模型由两个长短期记忆(LSTM)神经网络组成,分别训练于声学特征与自动语音识别(ASR)1-best 假设之上。随后训练一个前馈深度神经网络(DNN),将源自 LSTM 的声学嵌入与 1-best 嵌入同来自 ASR 解码器的特征相组合。实验结果表明,ASR 解码器、声学嵌入与 1-best 嵌入分别取得 9.3%、10.9% 与 20.1% 的等错误率(EER)。特征组合带来了 44% 的相对提升,最终 EER 为 5.2%。
引用
@article{arxiv.1808.02504,
title = {Device-directed Utterance Detection},
author = {Sri Harish Mallidi and Roland Maas and Kyle Goehner and Ariya Rastrow and Spyros Matsoukas and Björn Hoffmeister},
journal= {arXiv preprint arXiv:1808.02504},
year = {2018}
}
备注
Interspeech 2018 (accepted)