中文

面向超低功耗音频传感器的自学习个性化关键词检测

声音 2025-03-10 v2 机器学习 音频与语音处理

摘要

本文提出一种自学习方法,用于在部署于超低功耗智能音频传感器后,对个性化关键词检测(KWS)模型进行增量训练(微调)。我们解决训练数据缺乏的根本问题,通过基于与少量用户录制音频的相似度评分,对新录制的音频帧分配伪标签。通过在两个公开数据集上使用参数数目最高达0.5万的多种KWS模型进行实验,我们显示与初始在大型通用关键词集合上预训练的模型相比,准确率提升最高可达+19.2%和+16.0%。该标注任务在由低功耗麦克风和高效能单片机(MCU)组成的传感器系统上进行演示。通过高效利用MCU的异构处理引擎,始终开启的标注任务以实时方式运行,平均功耗最高可达8.2 mW。在同一平台上,我们估算的设备内训练能耗为标注能耗的10倍以下,当每6.1秒或18.8秒采样一个新语音时,分别使用DS-CNN-S或DS-CNN-M模型。我们的实证结果为极端边缘的自适应个性化KWS传感器铺平了道路。

关键词

引用

@article{arxiv.2408.12481,
  title  = {Self-Learning for Personalized Keyword Spotting on Ultra-Low-Power Audio Sensors},
  author = {Manuele Rusci and Francesco Paci and Marco Fariselli and Eric Flamand and Tinne Tuytelaars},
  journal= {arXiv preprint arXiv:2408.12481},
  year   = {2025}
}

备注

Published on IEEE IoT Journal