DONUT:基于CTC的按例查询关键词 spotting
机器学习
2018-11-28 v1 声音
音频与语音处理
机器学习
摘要
关键词 spotting(或称唤醒词检测)是现代声控设备免提操作的一项基本功能。随着此类设备变得无处不在,用户可能希望选择个性化的自定义唤醒词。在本工作中,我们提出DONUT,一种用于在线按例查询关键词 spotting 的基于CTC的算法,可实现自定义唤醒词检测。该算法通过记录用户的少量训练样本、从这些训练样本生成一组标签序列假设,并在给定新的音频录音时聚合所有假设的得分来检测唤醒词。我们的方法将基于CTC的关键词 spotting 的泛化能力与可解释性,与传统按例查询系统的用户自适应性与便利性相结合。DONUT计算需求低,非常适合于嵌入式系统上的学习与推理,且无需将用户私人数据上传至云端。
引用
@article{arxiv.1811.10736,
title = {DONUT: CTC-based Query-by-Example Keyword Spotting},
author = {Loren Lugosch and Samuel Myer and Vikrant Singh Tomar},
journal= {arXiv preprint arXiv:1811.10736},
year = {2018}
}
备注
Accepted to NeurIPS 2018 Workshop on Interpretability and Robustness for Audio, Speech, and Language