中文

面向可扩展多语言关键词 spotting 模型的区域编码

计算与语言 2023-02-28 v1 机器学习

摘要

多语言关键词 spotting(KWS)系统可跨多个区域检测口语关键词。传统的单语言KWS方法由于高开发/维护成本以及缺乏资源共享,不能很好地扩展到多语言场景。为克服此限制,我们提出两种区域条件通用模型,分别采用区域特征拼接和特征线性调制(FiLM)。我们将这些模型与两种基线方法比较:特定区域单语言KWS,以及在所有数据上训练的单一通用模型。在10个本地化语言数据集上的实验表明,区域条件模型在不同噪声条件下所有区域均大幅优于基线方法。FiLM表现最佳,与同等规模的单语言KWS模型相比,平均将误拒率(FRR)相对降低61%。

关键词

引用

@article{arxiv.2302.12961,
  title  = {Locale Encoding For Scalable Multilingual Keyword Spotting Models},
  author = {Pai Zhu and Hyun Jin Park and Alex Park and Angelo Scorza Scarpati and Ignacio Lopez Moreno},
  journal= {arXiv preprint arXiv:2302.12961},
  year   = {2023}
}

备注

Accepted for ICASSP 2023