中文

多标签鸟类声音分类器的不确定性校准

声音 2026-02-25 v2 机器学习

摘要

被动声学监测使大规模生物多样性评估成为可能,但可靠的生物声学声音分类不仅需要高准确率,还需要良好校准的不确定性估计以支撑决策。在生物声学领域,校准面临重叠发声、长尾物种分布以及训练与部署数据之间的分布偏移等挑战。多标签深度学习分类器在生物声学领域的校准尚未被评估。我们在 BirdSet 数据集上系统性地对四种最先进的多标签鸟类声音分类器进行校准基准测试,评估全球、每个数据集和每个类别的校准情况,使用无阈值的校准指标(ECE、MCS)以及判别指标(cmAP)。模型在不同数据集和类别之间的校准情况存在显著差异。虽然 Perch v2 和 ConvNeXtBS_{BS} 在全局校准方面表现更好,但结果在不同数据集之间存在差异。两种模型都表明持续低估,而 AudioProtoPNet 和 BirdMAE 则大多高估。意外的是,较少出现的类别似乎校准得更好。使用简单的事后校准方法,我们演示了一种 straightforward 的改善校准方式。小规模标注校准集即可显著提高 Platt scaling 下的校准,而全局校准参数因数据集变异性而受影响。我们的发现凸显了在生物声学分类器中评估和改进不确定性校准的重要性。

关键词

引用

@article{arxiv.2511.08261,
  title  = {Uncertainty Calibration of Multi-Label Bird Sound Classifiers},
  author = {Raphael Schwinger and Ben McEwen and Vincent S. Kather and René Heinrich and Lukas Rauch and Sven Tomforde},
  journal= {arXiv preprint arXiv:2511.08261},
  year   = {2026}
}

备注

Accepted at ICAART 2026