选择性注意系统(SAS):面向实时设备端语音检测的设备地址感知
声音
2026-04-10 v1 人工智能
音频与语音处理
摘要
我们研究了在ASR边缘部署约束下的设备地址语音检测,其中系统必须在严格的延迟和计算限制下决定是否转发音频进行转录。在多说话环境且说话时序模糊的情况下,我们表明该任务更有效地建模为对交互历史的顺序路由问题,而不是说话单元局部的分类任务。我们将其形式化为顺序设备地址路由(SDAR),并提出选择性注意系统(SAS),一种在设备端实现的框架。 在60小时多说话英文测试集上,主要仅使用音频的配置实现F1=0.86(精确率=0.89,召回率=0.83);采用可选摄像头的音频+视频融合配置将F1提升至0.95(精确率=0.97,召回率=0.93)。移除因果交互历史(Stage~3)后,音频+视频配置下的F1从0.95降至0.57±0.03。我们检测到的各组件中,这是观察到的最大性价比效应,表明在所评估的设置下,短期交互历史携带了大量决策相关信息。SAS在ARM Cortex-A类硬件上完全运行于设备端(<150 ms延迟,<20 MB存储占用)。所有结果均来自内部评估,其主要以英语为主;5小时的评估子集可能共享以便独立验证(第8.8节)。
引用
@article{arxiv.2604.08412,
title = {Selective Attention System (SAS): Device-Addressed Speech Detection for Real-Time On-Device Voice AI},
author = {David Joohun Kim and Daniyal Anjum and Bonny Banerjee and Omar Abbasi},
journal= {arXiv preprint arXiv:2604.08412},
year = {2026}
}