中文

GE2E-KWS:面向零样本关键词识别的广义端到端训练与评估

音频与语音处理 2026-02-06 v1 人工智能 机器学习

摘要

我们提出了GE2E-KWS——一个用于定制关键词识别的广义端到端训练与评估框架。具体来说,注册语音根据关键词从训练批次中分离并分组,其嵌入质心与所有其他测试语音嵌入进行比较以计算损失。这模拟了运行时注册和验证阶段,并通过优化矩阵运算,相比SOTA三元组损失方法,提高了收敛稳定性和训练速度。为了可靠地基准测试不同模型,我们提出了一个模拟生产环境的评估过程,并计算直接衡量关键词匹配准确率的指标。使用GE2E损失训练后,我们419KB的量化Conformer模型在相对AUC上比7.5GB的ASR编码器高出23.6%,并且比相同大小的三元组损失模型在AUC上高出60.7%。我们的KWS模型原生支持流式处理,内存占用低,并且设计为在设备上持续运行,无需针对新关键词进行重新训练(零样本)。

关键词

引用

@article{arxiv.2410.16647,
  title  = {GE2E-KWS: Generalized End-to-End Training and Evaluation for Zero-shot Keyword Spotting},
  author = {Pai Zhu and Jacob W. Bartel and Dhruuv Agarwal and Kurt Partridge and Hyun Jin Park and Quan Wang},
  journal= {arXiv preprint arXiv:2410.16647},
  year   = {2026}
}

备注

8 pages, 6 figures, 2 tables The paper is accepted in IEEE Spoken Language Technology (SLT) 2024