基于知识蒸馏的端侧受限自监督语音表征学习用于关键词 spotting
计算与语言
2023-07-07 v1 声音
音频与语音处理
摘要
大型自监督模型是有效的特征提取器,但在端侧资源受限和数据集采集有偏的情况下,尤其在关键词 spotting 中,其应用面临挑战。为此,我们提出了一种基于知识蒸馏的自监督语音表征学习(S3RL)架构,用于端侧关键词 spotting。我们的方法采用师生框架,利用双视图交叉相关蒸馏以及教师的码本作为学习目标,将知识从更大、更复杂的模型迁移到更小、轻量的模型。我们使用一个 16.6k 小时的内部数据集,在 Alexa 关键词 spotting 检测任务上评估了模型性能。我们的技术在正常与噪声条件下均展现出优异性能,证明了在端侧资源约束下,知识蒸馏方法在构建用于关键词 spotting 任务的自监督模型方面的有效性。
引用
@article{arxiv.2307.02720,
title = {On-Device Constrained Self-Supervised Speech Representation Learning for Keyword Spotting via Knowledge Distillation},
author = {Gene-Ping Yang and Yue Gu and Qingming Tang and Dongsu Du and Yuzong Liu},
journal= {arXiv preprint arXiv:2307.02720},
year = {2023}
}
备注
Accepted to Interspeech 2023