用于误触发缓解的互补语言模型与并行双向 lattice RNN
音频与语音处理
2020-08-20 v1 计算与语言
机器学习
声音
摘要
语音助手中的误触发是指助手的意外唤醒,不仅会降低用户体验,还可能危及隐私。误触发缓解(FTM)是一个检测误触发事件并对用户作出适当响应的过程。本文针对 FTM 问题提出了一种新颖的解决方案,即引入一个并行的 ASR 解码过程,配以从“域外”数据源训练得到的特殊语言模型。该语言模型对为助手任务优化的现有语言模型形成互补。由该互补语言模型生成的 lattice 训练得到的双向 lattice RNN(Bi-LRNN)分类器,在正确唤醒的误抑制(FS)率固定为 时,相比当前的 Bi-LRNN 模型,误触发(FT)率相对降低了 。此外,我们提出基于来自两个语言模型的解码 lattice 训练一个并行 Bi-LRNN 模型,并考察了多种实现方式。所得模型使误触发率进一步降低了 。
引用
@article{arxiv.2008.08113,
title = {Complementary Language Model and Parallel Bi-LRNN for False Trigger Mitigation},
author = {Rishika Agarwal and Xiaochuan Niu and Pranay Dighe and Srikanth Vishnubhotla and Sameer Badaskar and Devang Naik},
journal= {arXiv preprint arXiv:2008.08113},
year = {2020}
}