面向物联网应用的资源高效生物声学基础模型 BioME
音频与语音处理
2026-02-11 v1 声音
摘要
被动声学监测已成为生物多样性评估、保育和行为生态学中的关键策略,尤其是由于 Internet-of-Things (IoT) 设备使大规模的现场音频收集成为可能。虽然最近的自监督学习 (SSL)-based 音频编码器,如 BEATs 和 AVES,已在生物声学任务中显示出强大的性能,但其计算成本和对未见环境的有限鲁棒性阻碍了在资源受限平台上的部署。本文引入 BioME,一个为生物声学应用设计的资源高效音频编码器。BioME 通过来自高容量 teacher 模型的 layer-to-layer distillation 进行训练,实现了强大的 representational transfer 同时将参数数量减少 75%。为进一步提高生态学泛化能力,该模型在跨 speech、环境声和动物鸣叫等多域数据的预训练中进行。本文的关键贡献是通过 FiLM conditioning 集成 modulation-aware acoustic features,注入一种受 DSP 启发的归纳偏置,以增强 low-capacity 环境下的 feature disentanglement。在多个生物声学任务上,BioME 匹配或超越了更大模型的表现,包括其 teacher 模型,并且适用于资源受限的 IoT 部署。为可重复性,代码和预训练 checkpoint 均公开可用。
引用
@article{arxiv.2602.09970,
title = {BioME: A Resource-Efficient Bioacoustic Foundational Model for IoT Applications},
author = {Heitor R. Guimarães and Abhishek Tiwari and Mahsa Abdollahi and Anderson R. Avila and Tiago H. Falk},
journal= {arXiv preprint arXiv:2602.09970},
year = {2026}
}