animal2vec 与 MeerKAT:面向稀有事件原始音频输入的自监督Transformer及大规模生物声学参考数据集
声音
2026-04-15 v3 人工智能
音频与语音处理
定量方法
应用统计
摘要
生物声学研究对于理解动物行为、保护生物学和生态学至关重要,但面临一个巨大挑战:分析动物叫声稀少的庞大数据集。虽然深度学习技术正成为标准,但将其应用于生物声学仍然困难。我们通过animal2vec(一个可解释的大型Transformer模型)以及一个专为稀疏且不平衡的生物声学数据设计的自监督训练方案来解决这一问题。该模型从未标注的音频中学习,然后利用标注数据精炼其理解。此外,我们介绍并公开发布了MeerKAT:Meerkat Kalahari Audio Transcripts(猫鼬卡拉哈里音频转录数据集),这是一个包含毫秒级分辨率标注的猫鼬(Suricata suricatta)叫声数据集,是目前最大的非人类陆生哺乳动物标注数据集。我们的模型在MeerKAT和公开的NIPS4Bplus鸟类鸣声数据集上均优于现有方法。此外,即使在标注数据有限的情况下(少样本学习),animal2vec也表现良好。animal2vec和MeerKAT为生物声学研究提供了新的参考点,使科学家能够在真实标注信息稀缺的情况下分析大量数据。
引用
@article{arxiv.2406.01253,
title = {animal2vec and MeerKAT: A self-supervised transformer for rare-event raw audio input and a large-scale reference dataset for bioacoustics},
author = {Julian C. Schäfer-Zimmermann and Vlad Demartsev and Baptiste Averly and Kiran Dhanjal-Adams and Mathieu Duteil and Gabriella Gall and Marius Faiß and Lily Johnson-Ulrich and Dan Stowell and Marta B. Manser and Marie A. Roch and Ariana Strandburg-Peshkin},
journal= {arXiv preprint arXiv:2406.01253},
year = {2026}
}
备注
Code available at: https://github.com/livingingroups/animal2vec | Dataset available at: https://doi.org/10.17617/3.0J0DYB