基于端到端建模的流式意图查询检测用于持续对话
计算与语言
2022-08-30 v1 声音
音频与语音处理
摘要
在语音启用应用中,通常使用预定的热词来激活设备以处理查询。然而,在持续对话中每次说话都先说热词再跟查询会带来认知负担。为避免重复热词,我们提出了一种流式端到端(E2E)意图查询检测器,用于识别指向设备的话语并过滤掉其他非指向设备的话语。所提方法将意图查询检测器整合进已有的 E2E 模型,该模型已将语音识别流水线的不同组件折叠进一个神经网络。基于语音解码与意图查询检测的 E2E 建模还使我们能够根据早期部分识别结果声明快速的意图查询检测,这对于降低延迟并提升系统响应性十分重要。我们证明,相较于独立的意图查询检测器,所提 E2E 方法在检测准确率上取得了 22% 的相对等错误率(EER)提升,并改善了 600 ms 延迟。在我们的实验中,所提模型在用户开始说话后中位延迟 1.4 秒内以 8.7% 的 EER 检测出用户是否在向设备说话。
引用
@article{arxiv.2208.13322,
title = {Streaming Intended Query Detection using E2E Modeling for Continued Conversation},
author = {Shuo-yiin Chang and Guru Prakash and Zelin Wu and Qiao Liang and Tara N. Sainath and Bo Li and Adam Stambler and Shyam Upadhyay and Manaal Faruqui and Trevor Strohman},
journal= {arXiv preprint arXiv:2208.13322},
year = {2022}
}
备注
5 pages, Interspeech 2022