面向可扩展多语言关键词 spotting 模型的区域编码
计算与语言
2023-02-28 v1 机器学习
摘要
多语言关键词 spotting(KWS)系统可跨多个区域检测口语关键词。传统的单语言KWS方法由于高开发/维护成本以及缺乏资源共享,不能很好地扩展到多语言场景。为克服此限制,我们提出两种区域条件通用模型,分别采用区域特征拼接和特征线性调制(FiLM)。我们将这些模型与两种基线方法比较:特定区域单语言KWS,以及在所有数据上训练的单一通用模型。在10个本地化语言数据集上的实验表明,区域条件模型在不同噪声条件下所有区域均大幅优于基线方法。FiLM表现最佳,与同等规模的单语言KWS模型相比,平均将误拒率(FRR)相对降低61%。
引用
@article{arxiv.2302.12961,
title = {Locale Encoding For Scalable Multilingual Keyword Spotting Models},
author = {Pai Zhu and Hyun Jin Park and Alex Park and Angelo Scorza Scarpati and Ignacio Lopez Moreno},
journal= {arXiv preprint arXiv:2302.12961},
year = {2023}
}
备注
Accepted for ICASSP 2023