利用二值预排序改进灵长类动物声音深度学习分类
声音
2023-06-29 v1 计算机视觉与模式识别
机器学习
音频与语音处理
摘要
在野生动物观测与保护领域,基于音频录音的机器学习方法正日益流行。遗憾的是,该研究领域可用数据集往往并非理想的学习材料:样本可能弱标注、长度不一或信噪比差。本文引入一种通用方法,首先对 MEL 频谱表示的子段重新标注,以在实际多类分类任务上获得更高性能。对于二值预排序与分类,我们均采用卷积神经网络(CNN)及多种数据增强技术。我们在具有挑战性的 ComparE 2021 数据集上展示了该方法的结果,任务为区分不同灵长类物种声音,并报告了相较同等配置模型基线显著更高的准确率(Accuracy)与无加权平均召回率(UAR)分数。
引用
@article{arxiv.2306.16054,
title = {Improving Primate Sounds Classification using Binary Presorting for Deep Learning},
author = {Michael Kölle and Steffen Illium and Maximilian Zorn and Jonas Nüßlein and Patrick Suchostawski and Claudia Linnhoff-Popien},
journal= {arXiv preprint arXiv:2306.16054},
year = {2023}
}
备注
DeLTA