中文

NatureLM-audio:面向生物声学的音频-语言基础模型

声音 2025-07-01 v2 人工智能 机器学习 音频与语音处理

摘要

由文本和音频提示的大语言模型(LLM)在各种听觉任务(包括语音、音乐和通用音频)上达到了最先进性能,展现出在未见任务上的涌现能力。然而,它们在生物声学任务上的潜力尚未得到充分展示,这些任务包括在大规模录音中检测动物发声、分类稀有濒危物种、标注情境和行为——这些任务对保护、生物多样性监测和动物行为研究至关重要。在本工作中,我们提出了 NatureLM-audio,首个专门为生物声学设计的音频-语言基础模型。我们的训练数据集包含精心策划的文本-音频对,涵盖生物声学、语音和音乐,旨在解决该领域标注数据有限的问题。我们展示了从音乐和语音到生物声学的学习表征成功迁移,且模型对未见分类单元和任务表现出良好的泛化能力。我们在一个新基准(BEANS-Zero)上评估了 NatureLM-audio,它在多项生物声学任务上确立了新的最先进水平,包括未见物种的零样本分类。为推动生物声学研究,我们发布了模型权重、基准数据,并开源了训练代码、基准数据生成代码和模型训练代码。

关键词

引用

@article{arxiv.2411.07186,
  title  = {NatureLM-audio: an Audio-Language Foundation Model for Bioacoustics},
  author = {David Robinson and Marius Miron and Masato Hagiwara and Benno Weck and Sara Keen and Milad Alizadeh and Gagan Narula and Matthieu Geist and Olivier Pietquin},
  journal= {arXiv preprint arXiv:2411.07186},
  year   = {2025}
}

备注

Demo page: https://earthspecies.github.io/naturelm-audio-demo/