中文

DCASE 2022:面向低复杂度考虑的声学场景分类CNN比较分析

声音 2022-06-17 v1 机器学习 音频与语音处理

摘要

声学场景分类是一项自动听觉任务,旨在根据音频数据将录音划分至预定义场景。多年来(及往届DCASE中),该问题常通过称为集成的方法(在推理阶段使用多个机器学习模型组合其预测)解决。尽管这些方案在准确率上表现良好,但其计算开销极大,难以部署于IoT设备。由于该研究领域的变化,此任务对模型复杂度有两项限制。还需注意,设备不匹配(所提供的音频由不同信息源录制)也增加了复杂度。本技术报告对两种不同网络架构进行了比较研究:常规CNN与Conv-mixer。尽管两种网络均超过竞赛要求的基线,常规CNN表现出更高性能,超出基线8个百分点。基于Conv-mixer架构的方案性能较差,但其为轻量得多的方案。

关键词

引用

@article{arxiv.2206.08007,
  title  = {DCASE 2022: Comparative Analysis Of CNNs For Acoustic Scene Classification Under Low-Complexity Considerations},
  author = {Josep Zaragoza-Paredes and Javier Naranjo-Alcazar and Valery Naranjo and Pedro Zuccarello},
  journal= {arXiv preprint arXiv:2206.08007},
  year   = {2022}
}