学习溜奔: 使用深度架构进行象声分类、检测与端点化
声音
2025-04-03 v1 机器学习
音频与语音处理
定量方法
摘要
我们考虑在持续录制的音频中检测、隔离和分类象声的问题。这种自动声音特征识别有助于保护节育并为环境管理提供信息。与之前在片段级别进行声音检测的工作不同,本文在帧级进行声音检测,从而隐式实现了声音的端点化,即在更长的录音中隔离单个声响。为进行实验,我们采用了包含亚洲象和非洲象鸣叫的两个标注数据集。我们评估了多种浅层和深层分类器,表明使用尚未用于此任务的音频 spectrogram 转换器(AST)可显著提升性能,该网络架构我们以新颖的序列到序列方式进行配置。我们还表明,通过预训练实现迁移学习可进一步提升计算复杂度和性能。最后,我们考虑亚声级分类,采用被接受的鸣叫类型分类法,这一任务此前尚未被考虑。我们显示,在该情况下,转换器架构同样提供最佳性能。我们的最佳分类器在帧级二元声响分类中实现了0.962的平均精度(AP),在5类和7类声响分类中分别获得了0.957和0.979的受试者工作特征曲线下面积(AUC)。所有这些结果均代表新的基准(亚声级分类)或对先前最佳系统的提升。我们得出结论,完全自动的象声检测和亚声级分类系统已可实现。该系统将为保护和管理象群的行为与状态提供宝贵信息。
引用
@article{arxiv.2410.12082,
title = {Learning to rumble: Automated elephant call classification, detection and endpointing using deep architectures},
author = {Christiaan M. Geldenhuys and Thomas R. Niesler},
journal= {arXiv preprint arXiv:2410.12082},
year = {2025}
}