用于高效设备上误触发抑制的知识迁移
音频与语音处理
2020-10-22 v1 机器学习
声音
摘要
在本文中,我们解决判断给定话语是否指向语音智能助手设备的任务。非指向性话语被称为“误触发”,而误触发抑制(FTM)对于设计以隐私为中心的非侵入式智能助手至关重要。话语的指向性可通过对其运行自动语音识别(ASR)并分析ASR转写文本来确定用户意图来识别。但在误触发情况下,使用ASR转写音频本身是极不希望的。为缓解该问题,我们提出了一种基于LSTM的FTM架构,它直接从声学特征确定用户意图,而无需显式生成音频的ASR转写文本。所提模型占用空间小,可在计算资源有限的设备上运行。训练期间,模型参数采用知识迁移方法进行优化,其中更准确的自注意力图神经网络模型作为教师。给定完整音频片段,我们的方法在99%真正例率(TPR)下抑制了87%的误触发;在流式音频场景中,系统在拒绝误触发前仅监听1.69秒误触发音频,同时达到相同的TPR。
引用
@article{arxiv.2010.10591,
title = {Knowledge Transfer for Efficient On-device False Trigger Mitigation},
author = {Pranay Dighe and Erik Marchi and Srikanth Vishnubhotla and Sachin Kajarekar and Devang Naik},
journal= {arXiv preprint arXiv:2010.10591},
year = {2020}
}