中文

基于知识蒸馏的端侧受限自监督语音表征学习用于关键词 spotting

计算与语言 2023-07-07 v1 声音 音频与语音处理

摘要

大型自监督模型是有效的特征提取器,但在端侧资源受限和数据集采集有偏的情况下,尤其在关键词 spotting 中,其应用面临挑战。为此,我们提出了一种基于知识蒸馏的自监督语音表征学习(S3RL)架构,用于端侧关键词 spotting。我们的方法采用师生框架,利用双视图交叉相关蒸馏以及教师的码本作为学习目标,将知识从更大、更复杂的模型迁移到更小、轻量的模型。我们使用一个 16.6k 小时的内部数据集,在 Alexa 关键词 spotting 检测任务上评估了模型性能。我们的技术在正常与噪声条件下均展现出优异性能,证明了在端侧资源约束下,知识蒸馏方法在构建用于关键词 spotting 任务的自监督模型方面的有效性。

关键词

引用

@article{arxiv.2307.02720,
  title  = {On-Device Constrained Self-Supervised Speech Representation Learning for Keyword Spotting via Knowledge Distillation},
  author = {Gene-Ping Yang and Yue Gu and Qingming Tang and Dongsu Du and Yuzong Liu},
  journal= {arXiv preprint arXiv:2307.02720},
  year   = {2023}
}

备注

Accepted to Interspeech 2023