EdgeSpot:面向边缘设备的高效few-shot关键词检测模型
音频与语音处理
2026-01-26 v1 计算与语言
声音
摘要
我们介绍了一种面向边缘设备的高效few-shot关键词检测模型 EdgeSpot,它将优化版的基于 BC-ResNet 的声学主干与可训练的 Per-Channel Energy Normalization 前端以及轻量级时序自注意力机制相结合。训练时利用自监督教师模型进行知识蒸馏,并使用 Sub-center ArcFace loss 对教师模型进行优化。本研究表明,EdgeSpot 模型在固定误报率(FAR)下的准确率始终优于强大的 BC-ResNet 基线。最大变体 EdgeSpot-4 在 1% FAR 下的 10-shot 准确率从 73.7% 提升至 82.0%,仅需 29.4M MACs 且参数数目为 128k。
引用
@article{arxiv.2601.16316,
title = {EdgeSpot: Efficient and High-Performance Few-Shot Model for Keyword Spotting},
author = {Oguzhan Buyuksolak and Alican Gok and Osman Erman Okman},
journal= {arXiv preprint arXiv:2601.16316},
year = {2026}
}
备注
Accepted to be presented in IEEE ICASSP 2026