探索小足迹关键词 spotting 的表示学习
声音
2023-03-21 v1 计算与语言
机器学习
音频与语音处理
摘要
本文研究面向低资源关键词 spotting(KWS)的表示学习。KWS 的主要挑战是标注数据有限与可用设备资源有限。为应对这些挑战,我们通过自监督对比学习与使用预训练模型的自训练来探索 KWS 的表示学习。首先,设计局部-全局对比孪生网络(LGCSiam),通过所提出的局部-全局对比损失在无需真值的情况下为相似音频样本学习相似的语句级表示。其次,将自监督预训练的 Wav2Vec 2.0 模型作为约束模块(WVC)应用,迫使 KWS 模型学习帧级声学表示。借助 LGCSiam 与 WVC 模块,所提出的小足迹 KWS 模型可利用无标注数据进行预训练。在 Speech Commands 数据集上的实验表明,自训练 WVC 模块与自监督 LGCSiam 模块显著提升了准确率,尤其在小型标注数据集训练的情况下。
引用
@article{arxiv.2303.10912,
title = {Exploring Representation Learning for Small-Footprint Keyword Spotting},
author = {Fan Cui and Liyong Guo and Quandong Wang and Peng Gao and Yujun Wang},
journal= {arXiv preprint arXiv:2303.10912},
year = {2023}
}