用于硬件高效语音触发检测与误触发抑制的流式 Transformer
音频与语音处理
2021-05-17 v1 人机交互
机器学习
声音
摘要
我们提出一种统一且硬件高效的架构,用于两阶段语音触发检测(VTD)与误触发抑制(FTM)任务。语音助手的双阶段 VTD 系统可能被与感兴趣触发短语声学相似的音频段错误激活。FTM 系统利用触发后音频上下文来取消此类激活。传统 FTM 系统依赖自动语音识别格点,其在设备上计算开销昂贵。我们提出一种流式 transformer (TF) 编码器架构,其逐步处理 incoming 音频块并维持音频上下文,仅使用声学特征来执行 VTD 与 FTM 任务。所提出的联合模型在给定误报率下使 VTD 任务的误拒率(FRR)平均相对降低 18%。此外,我们的模型利用额外一秒触发后音频抑制了 95% 的误触发。最后,设备端测量显示相比该模型的非流式版本,运行内存减少 32%,推理时间减少 56%。
引用
@article{arxiv.2105.06598,
title = {Streaming Transformer for Hardware Efficient Voice Trigger Detection and False Trigger Mitigation},
author = {Vineet Garg and Wonil Chang and Siddharth Sigtia and Saurabh Adya and Pramod Simha and Pranay Dighe and Chandra Dhir},
journal= {arXiv preprint arXiv:2105.06598},
year = {2021}
}