中文

高效用户自定义关键词检测:双阶段匹配、多模态报名与持续适应

音频与语音处理 2026-05-22 v1 声音

摘要

用户自定义关键词检测(KWS)对于实现个性化语音交互至关重要,但现有方法面临多个挑战:(1)在易混淆词之间 discriminability 足不足,(2)不同发音者的说话者表现不一致,(3)确保可靠唤醒词性能的数据成本高。为此,本文引入DMA-KWS,一个高效且鲁健的用户自定义关键词检测框架。首先,采用双阶段匹配流程:使用CTC解码结合流式音素搜索定位候选片段,然后通过QbyT配合音素匹配器进行精细验证,使其能够更好地区分易混淆词。接下来,多模态报名融合用户特定语音与文本嵌入,进一步提高注册用户的准确度。最后,一个参数高效的持续适应机制使用合成数据和真实数据进行轻量级更新。广泛的实验表明,DMA-KWS性能卓越。在LibriPhrase Hard子集上,它实现了97.85%的AUC和6.13%的EER,达到了最先进的性能。在说话者依赖设置下,DMA-KWS始终优于文本唯一报名,显著提升了性能。此外,所提出的参数高效微调机制仅需更新187k参数,进一步提升了KWS性能,同时确保适用于设备端部署。

关键词

引用

@article{arxiv.2605.22120,
  title  = {Effective User-defined Keyword Spotting with Dual-stage Matching, Multi-modal Enrollment, and Continual Adaptation},
  author = {Zhiqi Ai and Han Cheng and Shiyi Mu and Xinnuo Li and Yongjin Zhou and Shugong Xu},
  journal= {arXiv preprint arXiv:2605.22120},
  year   = {2026}
}

备注

14 pages, 13 figures, 12 tables. Accepted by TASLP