中文

大规模河口声学遥测数据中的无监督异常检测

机器学习 2025-02-04 v1

摘要

声学遥测数据在理解水生动物的行为和移动方面起着至关重要的作用。然而,这些通常包含数百万个独立数据点的数据集,经常包含构成重大挑战的异常移动。传统上,异常移动是通过人工或基本统计方法识别的,这些方法耗时且在大型数据集中容易出现高比例的未识别异常。本研究专注于为包含来自南非布里德河口监测的五十条带有声学标签的暗色犬牙石首鱼探测数据的大型遥测数据集开发自动分类器。利用2016年至2021年间部署在整个河口的16个声学接收器阵列,我们收集了超过三百万个独立数据点。我们为数据预处理、重采样策略、标注过程、特征工程、数据划分方法以及用于异常检测的机器学习和深度学习模型的选择与解释提供了详细指南。在评估的模型中,神经网络自编码器(NN-AE)在我们提出的阈值寻找算法的辅助下表现出优越的性能。NN-AE实现了高召回率且无误报正常(即,没有将异常移动误分类为正常模式),这是确保没有真实异常被遗漏的关键因素。相比之下,其他模型表现出超过0.9的误报正常率,表明它们未能检测到大多数真实异常;这对于未检测到的异常可能扭曲移动模式解释的遥测研究来说是一个重大限制。虽然NN-AE的性能凸显了其在检测异常方面的可靠性和鲁棒性,但当正常移动模式逐渐偏离异常模式时,它在准确学习正常移动模式方面面临挑战。

关键词

引用

@article{arxiv.2502.01543,
  title  = {Unsupervised anomaly detection in large-scale estuarine acoustic telemetry data},
  author = {Siphendulwe Zaza and Marcellin Atemkeng and Taryn S. Murray and John David Filmalter and Paul D. Cowley},
  journal= {arXiv preprint arXiv:2502.01543},
  year   = {2025}
}