移动设备上基于Transformer的统一关键词 spotting与音频标注
声音
2023-03-06 v1 音频与语音处理
摘要
关键词 spotting(KWS)是大多数现代智能助手的核心人机交互前端任务。近来,提出了一种统一(UniKW-AT)框架,在KWS模型中以音频标注(AT)的形式增加额外能力。然而,先前工作未考虑UniKW-AT模型的实际部署,其中模型大小与推理速度等因素比单纯性能更为重要。本工作引入了三种可部署于移动设备的模型,称为统一Transformer(UiT)。我们的最佳模型在Audioset上取得34.09的mAP,在公开Google Speech Commands V1数据集上取得97.76的准确率。此外,我们在四个移动平台上对所提方法进行基准测试,揭示所提UiT模型相较具竞争力的MobileNetV2可实现2至6倍的加速。
引用
@article{arxiv.2303.01812,
title = {Unified Keyword Spotting and Audio Tagging on Mobile Devices with Transformers},
author = {Heinrich Dinkel and Yongqing Wang and Zhiyong Yan and Junbo Zhang and Yujun Wang},
journal= {arXiv preprint arXiv:2303.01812},
year = {2023}
}
备注
ICASSP 2023