基于卷积神经网络与谱图数据增强的外科口罩检测
音频与语音处理
2020-08-12 v1 计算机视觉与模式识别
机器学习
声音
摘要
在许多研究领域中,带标签的数据集难以获取。这正是数据增强有望在神经网络工程与分类任务背景下克服训练数据匮乏之处。其思路在于降低模型对小规模、低描述性训练数据集特征分布的过拟合。我们尝试评估此类数据增强技术,以洞察其为多种卷积神经网络在音频数据的梅尔谱图表示上所带来的性能提升。我们展示了数据增强在针对人声样本(ComParE Challenge 2020)的外科口罩二分类任务上的影响。同时我们考虑了四种不同架构以考察增强的鲁棒性。结果表明,ComParE 给出的大多数基线均被超越。
引用
@article{arxiv.2008.04590,
title = {Surgical Mask Detection with Convolutional Neural Networks and Data Augmentations on Spectrograms},
author = {Steffen Illium and Robert Müller and Andreas Sedlmeier and Claudia Linnhoff-Popien},
journal= {arXiv preprint arXiv:2008.04590},
year = {2020}
}
备注
5 pages, 2 figures, 2 tables