中文

有限数据下的掩码自编码器:有效吗?一项细粒度生物声学案例研究

声音 2026-05-15 v1 计算机视觉与模式识别 机器学习

摘要

生物声学识别需要细粒度的声学理解以区分发声相似的物种。然而,iNaturalist 等许多大规模数据存储库的标注较为薄弱,通常每段录音仅有一个正样本物种标签,这使得监督学习尤为困难。受计算机视觉进展的启发,近期的方法已转向自监督学习,以在不依赖详尽标注的情况下捕捉音频的内在结构。特别是,掩码自编码器(MAE)在超大规模音频语料上展现出强大的可迁移性,但其在更小规模的生物声学场景中的有效性仍未被充分探索。在本工作中,我们系统研究了在 iNatSounds 上进行物种分类的 MAE 预训练,分析了预训练数据规模、领域特异性、数据筛选和迁移策略的影响。与先前的工作一致,我们发现基于多样化通用音频数据预训练的模型在 iNatSounds 上取得了最佳的迁移性能。与大规模音频基准的观察相反,我们发现:(1) 在领域特定数据上进行额外的掩码重建预训练提供的收益有限,甚至可能降低现成模型的性能;(2) 当整体数据规模受限时,选择性数据过滤带来的优势微乎其微。我们的结果表明,在中等规模的细粒度生物声学场景中,预训练规模主导了目标设计。这些发现进一步阐明了基于 MAE 的预训练何时有效,并为有限监督下的模型选择提供了实用指导。

关键词

引用

@article{arxiv.2605.14031,
  title  = {Masked Autoencoders with Limited Data: Does It Work? A Fine-Grained Bioacoustics Case Study},
  author = {Wuao Liu and Mustafa Chasmai and Subhransu Maji and Grant Van Horn},
  journal= {arXiv preprint arXiv:2605.14031},
  year   = {2026}
}

备注

Workshop on Fine-Grained Visual Categorization (FGVC) at CVPR 2026. 8 pages, 6 figures