具有人类语言监督的可迁移生物声学模型
机器学习
2023-08-10 v1 声音
音频与语音处理
定量方法
摘要
被动声学监测提供了一种可扩展、非侵入性的方法来追踪全球生物多样性及人类活动对物种的影响。尽管深度学习已成为处理此类数据的重要工具,当前模型缺乏灵活性,通常仅覆盖少数物种,并受数据稀缺限制。本工作中,我们提出BioLingual,一种基于对比语言-音频预训练的生物声学新模型。我们首先将生物声学档案聚合为一个语言-音频数据集,称为AnimalSpeak,其包含超过一百万条音频-描述对,承载物种、鸣叫语境与动物行为信息。在该数据集上训练以连接语言与音频表征后,我们的模型能够跨类群识别超过一千个物种的叫声、零样本完成生物声学任务,并依据自然文本查询检索动物鸣叫录音。经微调后,BioLingual在Benchmark of Animal Sounds的九项任务上确立了新的最先进水平(SOTA)。鉴于其广泛的类群覆盖与以人类语言灵活查询的能力,我们相信该模型开启了生态监测与研究的新范式,包括在全球声学监测档案上的自由文本搜索。我们开源了模型、数据集与代码。
引用
@article{arxiv.2308.04978,
title = {Transferable Models for Bioacoustics with Human Language Supervision},
author = {David Robinson and Adelaide Robinson and Lily Akrapongpisak},
journal= {arXiv preprint arXiv:2308.04978},
year = {2023}
}