面向用户自定义关键词 spotting 的度量学习
音频与语音处理
2022-11-02 v1 声音
摘要
本工作的目标是检测用户定义的新的语音词项。虽然大多数先前工作将关键词 spotting(KWS)视为闭集分类问题,但这限制了其对未见过词项的迁移能力。定义自定义关键词的能力在用户体验方面具有优势。本文提出一种基于度量学习的用户自定义关键词 spotting 训练策略。具体而言,我们做出以下贡献:(1)我们利用现有语音语料库构建大规模关键词数据集,并提出一种过滤方法来剔除损害模型训练的数据;(2)我们提出一种基于度量学习的两阶段训练策略,并证明该方法通过丰富用户自定义关键词的表示提升了该任务的性能;(3)为促进用户自定义 KWS 领域的公平比较,我们提出了统一的评测协议与指标。我们提出的系统不需要对用户自定义关键词进行增量训练,并在 Google Speech Commands 数据集上使用所提及已有指标均大幅优于先前工作。
引用
@article{arxiv.2211.00439,
title = {Metric Learning for User-defined Keyword Spotting},
author = {Jaemin Jung and Youkyum Kim and Jihwan Park and Youshin Lim and Byeong-Yeol Kim and Youngjoon Jang and Joon Son Chung},
journal= {arXiv preprint arXiv:2211.00439},
year = {2022}
}