基于自监督语音表示的轻量级唤醒词检测特征编码器
音频与语音处理
2023-03-15 v1 声音
摘要
提供通用语音表示的自监督学习方法近来受到越来越多的关注。Wav2vec 2.0 是最著名的例子,在众多下游语音处理任务中展现出卓越性能。尽管其取得成功,但由于计算代价高昂,直接将其用于移动设备上的唤醒词检测仍具挑战性。在本工作中,我们提出 LiteFEW,一种用于唤醒词检测的轻量级特征编码器,以最小规模保留 wav2vec 2.0 的固有能力。该方法通过引入基于自编码器的降维技术压缩预训练 wav2vec 2.0 的知识,并蒸馏至 LiteFEW。在开源“Hey Snips”数据集上的实验结果表明,所提方法应用于多种模型结构时显著改善性能,仅用 64k 参数即实现超过 20% 的相对提升。
引用
@article{arxiv.2303.07592,
title = {Lightweight feature encoder for wake-up word detection based on self-supervised speech representation},
author = {Hyungjun Lim and Younggwan Kim and Kiho Yeom and Eunjoo Seo and Hoodong Lee and Stanley Jungkyu Choi and Honglak Lee},
journal= {arXiv preprint arXiv:2303.07592},
year = {2023}
}
备注
Accepted by ICASSP 2023