面向边缘端环境声音分类的微型 Transformer
声音
2021-03-24 v1 机器学习
音频与语音处理
摘要
随着物联网的发展与大数据的兴起,数据处理和机器学习应用正被迁移至边缘端廉价且低尺寸、重量和功耗(SWaP)的设备,通常以手机、嵌入式系统或微控制器的形式存在。网络物理测量与特征情报(MASINT)领域利用这些设备以其他方式无法实现的方式分析和利用数据,从而提高数据质量、增强安全性并降低带宽。然而,在边缘端训练和部署模型的方法有限,且精度足够的模型往往过大而不适于边缘设备。因此,明显需要用于在边缘端创建高效 AI/ML 的技术。本文提出边缘端环境声音分类领域中音频模型的训练技术。具体而言,我们设计并训练 Transformer 对音频片段中的办公室声音进行分类。结果表明,在梅尔谱图上训练的基于 BERT 的 Transformer 可用少 99.85% 的参数超越 CNN。为取得该结果,我们首先测试了若干为 Transformer 设计的音频特征提取技术,使用 ESC-50 进行评估,并配合多种增强方法。我们的最终模型在办公室声音数据集上优于基于 MFCC 的 CNN 这一当前最优模型,仅使用略超 6000 个参数——足以在微控制器上运行。
引用
@article{arxiv.2103.12157,
title = {Tiny Transformers for Environmental Sound Classification at the Edge},
author = {David Elliott and Carlos E. Otero and Steven Wyatt and Evan Martino},
journal= {arXiv preprint arXiv:2103.12157},
year = {2021}
}
备注
12 pages, submitted to IEEE Journal of Internet of Things