基于文本锚点的度量学习用于小 footprint 关键词 spotting
声音
2021-08-13 v1 人工智能
摘要
关键词 spotting (KWS) 在实现小 footprint 与高精度之间的权衡方面仍然具有挑战性。近期提出的度量学习方法提升了 KWS 任务的模型泛化能力,且基于 1D-CNN 的 KWS 模型在模型尺寸上达到了最先进 (SOTA) 水平。然而,对于度量学习,由于数据限制,语音锚点极易受声学环境和说话人影响。此外,我们注意到 1D-CNN 模型捕捉长期时序声学特征的能力有限。为解决上述问题,我们提出利用文本锚点来提升锚点的稳定性。进一步地,精心设计了一种新型模型 (LG-Net),基于 1D-CNN 和自注意力来促进长短时声学特征建模。实验在 Google Speech Commands Dataset 第一版 (GSCDv1) 和第二版 (GSCDv2) 上进行。结果表明,所提出的基于文本锚点的度量学习方法在代表性 CNN 基模型上相比语音锚点有稳定提升。此外,我们的 LG-Net 模型在两个数据集上分别取得了 97.67% 和 96.79% 的 SOTA 准确率。令人鼓舞的是,我们仅含 74k 参数的更轻量 LG-Net 在 GSCDv1 上获得了 96.82% 的 KWS 准确率,在 GSCDv2 上获得了 95.77% 的 KWS 准确率。
引用
@article{arxiv.2108.05516,
title = {Text Anchor Based Metric Learning for Small-footprint Keyword Spotting},
author = {Li Wang and Rongzhi Gu and Nuo Chen and Yuexian Zou},
journal= {arXiv preprint arXiv:2108.05516},
year = {2021}
}
备注
Accepted for Interspeech2021