中文

声学场景分类上的神经架构搜索

声音 2020-08-06 v2 机器学习 音频与语音处理 机器学习

摘要

卷积神经网络被广泛用于声学场景分类(ASC)任务,但它们通常带来沉重的计算负担。本工作中,我们提出了一个受 MobileNetV2 启发的轻量且高性能的基线网络,其用单向卷积核替换方形卷积核,以在时间和频率维度交替提取特征。此外,我们基于所提基线并利用最近的神经架构搜索(NAS)范式探索了一个动态架构空间,该方法首先训练一个包含所有候选网络的超网,然后应用著名的进化算法 NSGA-II 来发现具有更高精度和更低计算成本的更高效网络。实验结果表明,我们搜索出的网络在 ASC 任务中表现优异,在 DCASE2018 task 5 评测集上取得了 90.3% 的 F1-score,在比基线网络节省 25% FLOPs 的同时标志着新的 SOTA 性能。

关键词

引用

@article{arxiv.1912.12825,
  title  = {Neural Architecture Search on Acoustic Scene Classification},
  author = {Jixiang Li and Chuming Liang and Bo Zhang and Zhao Wang and Fei Xiang and Xiangxiang Chu},
  journal= {arXiv preprint arXiv:1912.12825},
  year   = {2020}
}

备注

Accepted to Interspeech 2020