基于机器学习的通过鸟鸣对鸟类进行分类
机器学习
2022-12-12 v1 声音
音频与语音处理
摘要
音频声音识别与分类被用于诸多任务与应用,包括人声识别、音乐识别与音频标注。本文中,我们结合梅尔频率倒谱系数(Mel Frequency Cepstral Coefficients, MFCC)与一系列机器学习模型,从公开可得的鸟鸣音频文件中识别(澳大利亚)鸟类。我们给出用于数据处理与增强的方法,并比较多种前沿机器学习模型的结果。对于选作案例研究的 30 种鸟类中排名前 5 的鸟类,我们取得了 91% 的总体准确率。将模型应用于包含 152 种鸟类、更具挑战性与多样性的音频文件时,我们取得了 58% 的准确率。
引用
@article{arxiv.2212.04684,
title = {Machine Learning-based Classification of Birds through Birdsong},
author = {Yueying Chang and Richard O. Sinnott},
journal= {arXiv preprint arXiv:2212.04684},
year = {2022}
}