中文

DONUT:基于CTC的按例查询关键词 spotting

机器学习 2018-11-28 v1 声音 音频与语音处理 机器学习

摘要

关键词 spotting(或称唤醒词检测)是现代声控设备免提操作的一项基本功能。随着此类设备变得无处不在,用户可能希望选择个性化的自定义唤醒词。在本工作中,我们提出DONUT,一种用于在线按例查询关键词 spotting 的基于CTC的算法,可实现自定义唤醒词检测。该算法通过记录用户的少量训练样本、从这些训练样本生成一组标签序列假设,并在给定新的音频录音时聚合所有假设的得分来检测唤醒词。我们的方法将基于CTC的关键词 spotting 的泛化能力与可解释性,与传统按例查询系统的用户自适应性与便利性相结合。DONUT计算需求低,非常适合于嵌入式系统上的学习与推理,且无需将用户私人数据上传至云端。

关键词

引用

@article{arxiv.1811.10736,
  title  = {DONUT: CTC-based Query-by-Example Keyword Spotting},
  author = {Loren Lugosch and Samuel Myer and Vikrant Singh Tomar},
  journal= {arXiv preprint arXiv:1811.10736},
  year   = {2018}
}

备注

Accepted to NeurIPS 2018 Workshop on Interpretability and Robustness for Audio, Speech, and Language