中文

通过自监督预训练改进标签匮乏的关键词 spotting

声音 2023-05-25 v3 人机交互 机器学习 音频与语音处理

摘要

关键词 spotting(KWS)模型正日益集成至各类系统中,例如语音助手。为获得满意性能,这些模型通常依赖大量标注数据,使其应用仅限于此类数据可得的场景。自监督学习(SSL)方法可通过利用易得的未标注数据来缓解此种依赖。多数面向语音的SSL方法主要在大型模型上研究,而这并不理想,因为通常亟需紧凑的KWS模型。本文探究了SSL在小型KWS模型上的有效性,并确立在标注数据稀缺时SSL可提升小型KWS模型性能。我们使用Data2Vec对三个紧凑的基于transformer的KWS模型进行预训练,并在Google Speech Commands数据集的标签匮乏设定下微调。研究发现,Data2Vec预训练带来了准确率的显著提升,标签匮乏场景下绝对准确率提高了8.22%–11.18%。

关键词

引用

@article{arxiv.2210.01703,
  title  = {Improving Label-Deficient Keyword Spotting Through Self-Supervised Pretraining},
  author = {Holger Severin Bovbjerg and Zheng-Hua Tan},
  journal= {arXiv preprint arXiv:2210.01703},
  year   = {2023}
}

备注

To be published at ICASSP2023 Workshop on Self-supervision in Audio, Speech and Beyond, 10th of June 2023, Rhodes, Greece. Copyright (c) 2023 IEEE. 5 pages, 3 figures, 3 tables