面向动物声音分类的高级框架:特征优化
声音
2024-07-08 v1 机器学习
音频与语音处理
摘要
动物声音的自动分类是生物声学中的一项持久挑战,原因在于声信号具有多样的统计特性、录音设备的差异以及常见的低信噪比(SNR)条件。深度学习模型如卷积神经网络(CNN)和长短期记忆网络(LSTM)在人类语音识别中表现出色,但尚未有效针对动物声音的复杂特性进行优化,因为动物声音即使在同一领域内也呈现出显著的多样性。我们提出了一个适用于通用动物声音分类的自动化分类框架。该方法首先优化了梅尔频率倒谱系数(MFCC)中的音频特征,包括特征重组和特征降维。随后利用优化后的特征输入基于注意力机制的双向LSTM(Bi-LSTM)进行深度语义特征提取,以实现声音分类。我们还贡献了一个涵盖海洋动物和鸟类的动物声音基准数据集。通过实地数据集的广泛实验测试,表明该方法在精确率、召回率和准确率上 consistently 超过基线方法25%以上,为动物声音分类的发展带来了希望。
引用
@article{arxiv.2407.03440,
title = {Advanced Framework for Animal Sound Classification With Features Optimization},
author = {Qiang Yang and Xiuying Chen and Changsheng Ma and Carlos M. Duarte and Xiangliang Zhang},
journal= {arXiv preprint arXiv:2407.03440},
year = {2024}
}