中文

AnimalCLAP:面向物种识别与特征推断的基于生态分类学的语言-音频预训练框架

声音 2026-03-24 v1 机器学习

摘要

动物鸣叫为野生动物评估提供了关键信息,尤其是在森林等复杂环境中,有助于物种识别和生态监测。近期深度学习技术的进展使自动从鸣叫中进行物种分类成为可能。然而,针对训练期间未出现的物种进行分类仍然具有挑战性。为此,我们提出了 AnimalCLAP,一个集成分层生物学信息的生态分类学语言-音频框架,包括新构建的数据集和模型。具体而言,我们的鸣叫数据集包含 4,225 小时的录音,覆盖 6,823 个物种,并标注了 22 个生态特征。该 AnimalCLAP 模型在此数据集上训练,用于对齐音频和文本表示,利用生态分类学结构以提升对未见物种的识别能力。我们证明,该提出的方法能够直接从鸣叫中推断物种的生态和生物学属性,性能优于 CLAP。本数据集、代码和模型将在 https://dahlian00.github.io/AnimalCLAP_Page/ 公开。

关键词

引用

@article{arxiv.2603.22053,
  title  = {AnimalCLAP: Taxonomy-Aware Language-Audio Pretraining for Species Recognition and Trait Inference},
  author = {Risa Shinoda and Kaede Shiohara and Nakamasa Inoue and Hiroaki Santo and Fumio Okura},
  journal= {arXiv preprint arXiv:2603.22053},
  year   = {2026}
}

备注

ICASSP 2026