基于 phoneme 级别对比学习的用户自定义关键词检测及其灵活的报名方式
音频与语音处理
2024-12-31 v1 声音
摘要
用户自定义关键词检测(KWS)通过允许用户自定义关键词来提升用户体验。然而,在开放词汇场景中,大多数现有方法都会 suffer from 高误报率(confusable words)且仅限于音频-唯一或文本-唯一报名。因此,本文首先探索模型对混淆词的鲁棒性。具体地,我们提出了基于 phoneme 级别的对比学习(PLCL),该方法在 phoneme 级别细化和对齐查询和源特征表示。该方法通过对更精确的对齐进行细粒度的正负比较来增强模型的消歧能力,并且具有普适性,可适用于联合优化音频-文本和音频-音频匹配,适应各种报名模式。此外,我们保持上下文无关的 phoneme 记忆库,以构建混淆负样本进行数据增强。基于此,我们专门设计了一个第三类别的鉴别器来区分硬负样本。总体而言,我们开发了一个健壮且灵活的KWS系统,支持在统一框架内实现不同的模态报名方式。在LibriPhrase数据集上验证后,所提出的方法实现了最先进的性能。
引用
@article{arxiv.2412.20805,
title = {Phoneme-Level Contrastive Learning for User-Defined Keyword Spotting with Flexible Enrollment},
author = {Li Kewei and Zhou Hengshun and Shen Kai and Dai Yusheng and Du Jun},
journal= {arXiv preprint arXiv:2412.20805},
year = {2024}
}