中文

ARIONet:一种用于鸟鸣分类和未来帧预测的高级自监督对比表示网络

声音 2025-10-28 v3

摘要

自动鸟鸣分类是推动生态监测和生物多样性研究的关键步骤。尽管近期取得的进展,但现有方法往往严重依赖标记数据、使用有限的特征表示,并忽视鸟鸣识别中必不可少的时序动态。本文提出一种自监督对比网络ARIONet(Acoustic Representation for Interframe Objective Network),该网络联合优化对比分类和未来帧预测,使用增强后的音频表示。该模型同时整合了多个互补音频特征于基于Transformer的编码器模型中。我们的框架包含两个关键目标:(1) 通过最大化同一音频片段不同增强视图之间的相似性,同时推远不同样本之间来学习判别性的物种特定表示进行对比学习;(2) 在不 requiring 大规模标注的情况下建模时序动态以预测未来音频帧。我们在四个多样化的鸟鸣数据集上验证了该框架,包括英国鸟鸣数据集、鸟鸣数据集以及两个扩展的Xeno-Canto子集(A-M和N-Z)。本方法在所有数据集上均显著优于现有基线方法,分类准确率分别达到98.41%、93.07%、91.89%和91.58%,F1分数分别为97.84%、94.10%、91.29%和90.94%。此外,该方法在未来帧预测任务中表现出低的平均绝对误差和最高达95%的余弦相似度。广泛的实验进一步确认了我们自监督学习策略在捕捉复杂声学模式和时序依赖方面的有效性,以及其在生态保护和监测中的实际应用潜力。

关键词

引用

@article{arxiv.2510.00522,
  title  = {ARIONet: An Advanced Self-supervised Contrastive Representation Network for Birdsong Classification and Future Frame Prediction},
  author = {Md. Abdur Rahman and Selvarajah Thuseethan and Kheng Cher Yeo and Reem E. Mohamed and Sami Azam},
  journal= {arXiv preprint arXiv:2510.00522},
  year   = {2025}
}