LLM-Synth4KWS:面向自定义关键词检测的易混淆数据可扩展自动生成与合成
音频与语音处理
2026-02-06 v1 声音
摘要
自定义关键词检测(KWS)允许从流式音频中检测用户定义的口语关键词。这是通过比较语音注册和输入音频的嵌入来实现的。最先进的自定义 KWS 模型通常使用从训练数据集中随机采样的包含关键词的话语进行对比训练。这些 KWS 模型常常在处理易混淆关键词时遇到困难,例如“blue”与“glue”。本文介绍了一种有效的训练增强方法,利用大语言模型(LLM)生成并分组关键词,并利用文本转语音(TTS)引擎合成具有多种说话风格的语音信号,从而生成易混淆话语。为了更好地衡量易混淆 KWS 上的用户体验,我们定义了一个新的北极星指标,使用来自易混淆组的 DET 曲线下的平均面积(c-AUC)。所提方法具有高可扩展性和零人工成本的特点,在 Speech Commands 测试集上将 AUC 提高了 3.7%,c-AUC 提高了 11.3%。
引用
@article{arxiv.2505.22995,
title = {LLM-Synth4KWS: Scalable Automatic Generation and Synthesis of Confusable Data for Custom Keyword Spotting},
author = {Pai Zhu and Quan Wang and Dhruuv Agarwal and Kurt Partridge},
journal= {arXiv preprint arXiv:2505.22995},
year = {2026}
}