中文

基于语音与触摸唤醒的端侧流式设备指向语音检测

声音 2021-10-12 v1 机器学习 音频与语音处理

摘要

在与手机或可穿戴设备等智能设备交互时,用户通常通过说出关键词或按下设备上的按钮来唤醒虚拟助手(VA)。然而,在许多情况下,VA 可能被类关键词语音或误触按钮意外唤醒,这可能影响用户体验与隐私。为此,我们提出一种用于端侧设备指向语音检测的声学误唤醒缓解(FTM)方法,其同时处理语音唤醒与触摸唤醒。为便于模型在端侧部署,我们引入一种新的流式决策层,其基于以计算高效著称的时序卷积网络(TCN)[1] 的概念推导而来。据我们所知,这是首个能以流式方式从多种唤醒类型中检测设备指向语音的方法。我们将该方法与基于普通平均层和规范 LSTM 的流式替代方案进行比较,并显示:(i)所有模型相比唤醒专用模型仅有微小精度下降;(ii)新引入的流式 TCN 始终优于或与替代方案相当,同时能更快地缓解设备非指向语音,且与非流式对应方法相比,基于 LSTM 的方法在运行峰值内存上相对减少 33% 对比 7%。

关键词

引用

@article{arxiv.2110.04656,
  title  = {Streaming on-device detection of device directed speech from voice and touch-based invocation},
  author = {Ognjen Rudovic and Akanksha Bindal and Vineet Garg and Pramod Simha and Pranay Dighe and Sachin Kajarekar},
  journal= {arXiv preprint arXiv:2110.04656},
  year   = {2021}
}