中文

基于变分自编码器和时序卷积网络的弱标签生物声学 cetacean 数据集中的时序特征学习:一种跨学科方法

声音 2025-11-04 v3 音频与语音处理 定量方法

摘要

被动声学监测 (PAM) 的生物声学数据为分类带来了独特的挑战,特别是由于标注不确定性、生物学复杂性(由于鲸类声呆持续时间的异质性)以及目标声音被环境和人为噪声掩盖,导致数据常常是弱标签化的,标注仅指示物种的存在/不存在持续数分钟。为了有效捕获长连续音频段的复杂时序模式和关键特征,我们提出了一种跨学科框架,包括数据标准化、通过变分自编码器 (VAE) 的特征提取以及通过时序卷积网络 (TCN) 的分类。该方法消除了对手动阈值设置或耗时的强标注的必要性。为了演示我们方法的有效性,我们以海豚 (Physeter macrocephalus) 的 click train 在 4 分钟录音中作为案例研究,该数据集包含多样化的来源和部署条件,以最大化可泛化性。通过 VAE 提取特征的价值通过将分类性能与传统且可解释的方法(专家手工挑选特征)进行比较来证明。TCN demonstrated 出健壮的分类能力,AUC 分数超过 0.9。

关键词

引用

@article{arxiv.2410.17006,
  title  = {Temporal Feature Learning in Weakly Labelled Bioacoustic Cetacean Datasets via a Variational Autoencoder and Temporal Convolutional Network: An Interdisciplinary Approach},
  author = {Laia Garrobé Fonollosa and Douglas Gillespie and Lina Stankovic and Vladimir Stankovic and Luke Rendell},
  journal= {arXiv preprint arXiv:2410.17006},
  year   = {2025}
}