GraphemeAug:用于综合硬负性关键词定位示例的系统方法
声音
2026-02-06 v2 计算与语言
音频与语音处理
摘要
口语关键词定位(KWS)是区分关键词在音频中是否存在的任务。KWS 模型的准确性取决于其正确分类靠近关键词与非关键词边界的示例的能力。这些边界示例在训练数据中往往稀缺,限制了模型性能。本文提出了一种系统方法,通过对关键词 grapheme 进行插入/删除/替换编辑来系统生成靠近决策边界的对抗性示例。我们在流行关键词的 held-out 数据上对该技术进行评估,结果表明该技术在合成硬负性数据集上的 AUC 提升了 61%,同时在正样本和环境负性音频数据上保持了质量。
引用
@article{arxiv.2505.14814,
title = {GraphemeAug: A Systematic Approach to Synthesized Hard Negative Keyword Spotting Examples},
author = {Harry Zhang and Kurt Partridge and Pai Zhu and Neng Chen and Hyun Jin Park and Dhruuv Agarwal and Quan Wang},
journal= {arXiv preprint arXiv:2505.14814},
year = {2026}
}
备注
Accepted at Interspeech 2025