不留痕迹的词:消除开放词汇关键词识别中的前缀偏差
声音
2026-02-13 v3
摘要
开放词汇关键词识别 (OV-KWS) 使设备能够通过任意语音命令实现个人化控制。最近的研究者探索了使用 audio-text 联合嵌入,允许用户以文本形式注册短语,并提出了消除类似语音的技术。我们发现现有的 OV-KWS 解决方案常常过度偏向注册开头的音素,导致当负样本注册-查询-配对共享前缀时发生误触发(如 "turn the volume up" 与 "turn the volume down")。我们追溯到两个因素:训练数据偏差和位置偏置的 cross-modal 评分。为解决这些限制,我们引入了包含不匹配 audio-text 对且共享前缀的 Partial Overlap Benchmark (POB),包括 POB-Spark 和 POB-LibriPhrase (POB-LP) 两个数据集,并提出了 Equal-weighting Position Scoring (EPS),一种轻量级决策层。仅使用 EPS 即可将 POB-Spark 的 EER 从 64.4% 降至 29.3%,并将 POB-LP 的准确率提升至 96.8%,同时保持在 LibriPhrase 和 Google Speech Commands (GSC) 上的性能。在训练中添加 POB 数据后,我们的工作在 POB 基准上取得最佳结果,同时在先前指标上 incur 最小程度的性能下降。这种下降在包含仅单字命令的 GSC 中最为显著。我们将缓解这一权衡置于未来工作之中。
引用
@article{arxiv.2602.08930,
title = {No Word Left Behind: Mitigating Prefix Bias in Open-Vocabulary Keyword Spotting},
author = {Yi Liu and Chuan-Che Huang and Xiao Quan},
journal= {arXiv preprint arXiv:2602.08930},
year = {2026}
}
备注
Published in ICASSP 2026