Synaspot:面向关键词检测的轻量级流式多模态框架,基于音频-文本协同
声音
2025-12-18 v1
摘要
在连续语音流中的开词汇关键词检测(KWS)在广泛的实际应用场景中具有重要价值。尽管越来越多的研究关注不同模态在 KWS 中的作用,但对其有效性的认识已明确。然而,多模态集成带来的参数成本增加,以及端到端部署的限制,使得此类模型在实际应用中的适用性受到限制。为此,我们提出一种轻量级流式多模态框架。首先,我们聚焦于多模态注册特征,降低语音注册中与说话者相关(声纹)的信息,以提取与说话者无关的特征。其次,我们有效地融合语音和文本特征。最后,我们引入一种流式解码框架,仅需编码器提取特征,然后通过我们三种模态表示进行数学解码。在 LibriPhase 和 WenetPrase 上的实验表明,我们的模型表现良好。与现有流式方法相比,我们的方法在显著降低参数数量的同时实现了更好的性能。
引用
@article{arxiv.2512.15124,
title = {Synaspot: A Lightweight, Streaming Multi-modal Framework for Keyword Spotting with Audio-Text Synergy},
author = {Kewei Li and Yinan Zhong and Xiaotao Liang and Tianchi Dai and Shaofei Xue},
journal= {arXiv preprint arXiv:2512.15124},
year = {2025}
}