基于CNN的音频标签模型在资源受限设备上的全面评估
声音
2025-09-22 v2 人工智能
音频与语音处理
摘要
卷积神经网络(CNN)在音频标签任务中展现出卓越的性能。然而,在类树莓派等资源受限设备上部署这些模型会面临计算效率和热管理挑战。本文对多个卷积神经网络(CNN)架构在树莓派上的音频标签进行全面评估,涵盖Pretrained Audio Neural Networks(PANNs)框架中的全部1D和2D模型、适用于音频分类的基于ConvNeXt的模型,以及MobileNetV3架构。此外,还评估了两个最近提出的PANNs派生网络,CNN9和CNN13。为提升部署效率和跨异构硬件平台的可移植性,所有模型均转换为Open Neural Network Exchange(ONNX)格式。不同于侧重单一模型的前期工作,本文的分析涵盖更广泛的架构范围,并进行持续24小时的推理测试以评估性能稳定性。实验结果表明,通过合适的模型选择和优化,能够在长时间运行期间保持一致的推理延迟并有效管理热行为态。这些发现为在实际边缘计算场景中部署音频标签模型提供了宝贵的见解。
引用
@article{arxiv.2509.14049,
title = {Comprehensive Evaluation of CNN-Based Audio Tagging Models on Resource-Constrained Devices},
author = {Jordi Grau-Haro and Ruben Ribes-Serrano and Javier Naranjo-Alcazar and Marta Garcia-Ballesteros and Pedro Zuccarello},
journal= {arXiv preprint arXiv:2509.14049},
year = {2025}
}
备注
Accepted at Computing Conference 2026, London, UK