遮蔽自编码器是否也能聆听鸟鸣?
机器学习
2025-08-20 v4 声音
音频与语音处理
摘要
遮蔽自编码器 (MAE) 通过高效的自监督重建任务在音频分类中学习丰富的语义表示。然而,通用模型在直接应用于细粒度音频领域时难以很好地泛化。具体而言,鸟鸣分类需要区分不同物种间的细微差异并管理高的种内声学变异性,这揭示了通用领域 Audio-MAEs 的性能局限性。这项工作证明,弥合这一领域差距需要完整的管道调整,而不仅仅是领域特定的预训练数据。我们系统地重审并调整了预训练配方、微调方法以及冻结特征的利用,以适用于鸟类声音,使用 BirdSet——一个与 AudioSet 相当的大型生物声学数据集。我们的 Bird-MAE 在 BirdSet 多标签分类基准上取得了新的最佳结果。此外,我们引入参数效率的原型探测,增强了冻结 MAE 表示的实用性,使其在低资源设置下接近微调性能。Bird-MAE 的原型探测在平均精度提升最高可达 37 个百分点,并且在 BirdSet 下游任务中缩小了与微调的差距。Bird-MAE 还在我们新建立的 BirdSet 少样本基准上展示了稳健的零样本能力,凸显了针对细粒度音频领域的定制自监督学习管道的潜力。
引用
@article{arxiv.2504.12880,
title = {Can Masked Autoencoders Also Listen to Birds?},
author = {Lukas Rauch and René Heinrich and Ilyass Moummad and Alexis Joly and Bernhard Sick and Christoph Scholz},
journal= {arXiv preprint arXiv:2504.12880},
year = {2025}
}
备注
accepted @TMLR: https://openreview.net/forum?id=GIBWR0Xo2J