面向稳健双阶段用户自定义关键词检测的双数据缩放
声音
2025-10-14 v1
摘要
本文提出 DS-KWS,一个用于稳健用户自定义关键词检测的双阶段框架。它将基于 CTC 的方法与流式音素搜索模块组合,用于定位候选片段,然后使用基于 QbyT 的方法和音素匹配模块在音素和句子水平上进行验证。为进一步提高性能,我们引入双数据缩放策略:(1) 将 ASR 语料从 460 小时扩展到 1,460 小时以强化声学模型;(2) 利用超过 155k 的锚定类来训练音素匹配器,显著增强混淆词的区分度。在 LibriPhrase 上实验,DS-KWS 显著优于现有方法,在 Hard 子集上实现 6.13% EER 和 97.85% AUC。在 Hey-Snips 上,它实现了相当于全数据训练模型的零样本性能,达到每小时一次误报时 99.13% 的召回率。
引用
@article{arxiv.2510.10740,
title = {Dual Data Scaling for Robust Two-Stage User-Defined Keyword Spotting},
author = {Zhiqi Ai and Han Cheng and Yuxin Wang and Shiyi Mu and Shugong Xu and Yongjin Zhou},
journal= {arXiv preprint arXiv:2510.10740},
year = {2025}
}
备注
5 pages, 3 figures