中文

用于误触发缓解的互补语言模型与并行双向 lattice RNN

音频与语音处理 2020-08-20 v1 计算与语言 机器学习 声音

摘要

语音助手中的误触发是指助手的意外唤醒,不仅会降低用户体验,还可能危及隐私。误触发缓解(FTM)是一个检测误触发事件并对用户作出适当响应的过程。本文针对 FTM 问题提出了一种新颖的解决方案,即引入一个并行的 ASR 解码过程,配以从“域外”数据源训练得到的特殊语言模型。该语言模型对为助手任务优化的现有语言模型形成互补。由该互补语言模型生成的 lattice 训练得到的双向 lattice RNN(Bi-LRNN)分类器,在正确唤醒的误抑制(FS)率固定为 0.4%0.4\% 时,相比当前的 Bi-LRNN 模型,误触发(FT)率相对降低了 38.34%38.34\%。此外,我们提出基于来自两个语言模型的解码 lattice 训练一个并行 Bi-LRNN 模型,并考察了多种实现方式。所得模型使误触发率进一步降低了 10.8%10.8\%

关键词

引用

@article{arxiv.2008.08113,
  title  = {Complementary Language Model and Parallel Bi-LRNN for False Trigger Mitigation},
  author = {Rishika Agarwal and Xiaochuan Niu and Pranay Dighe and Srikanth Vishnubhotla and Sameer Badaskar and Devang Naik},
  journal= {arXiv preprint arXiv:2008.08113},
  year   = {2020}
}