中文

线性探针使下水声目标识别得以解码:基于预训练音频嵌入的实验性研究

机器学习 2026-01-14 v1 声音 音频与语音处理

摘要

船只日益增加的人为噪声对海洋生态系统构成显著威胁,亟需监测以理解并量化船只辐射噪声的影响。被动声学监测 (PAM) 系统广泛部署用于此目的,生成跨异构声景的多年 underwater recordings。手动分析此类大规模数据不可行,催生基于机器学习的自动化方法。最近的下水声目标识别 (UATR) 进展主要依赖监督学习,这受限于标注数据的稀缺。迁移学习 (TL) 提供了可行的替代方案。本文开展首个针对 UATR 的迁移学习经验比较研究,评估来自多样化音频领域的多个预训练音频模型。预训练模型权重被冻结,分析其生成的嵌入通过分类、聚类和相似性评估。分析表明,嵌入空间的几何结构主要由 recording-specific 特征主导。然而,简单线性探针可有效抑制这种 recording-specific 信息,提取出船只类型特征。因此,线性探针在低计算成本下即可实现有效的 UATR,显著减少对大量高质量标注船只 recordings 的需求。

关键词

引用

@article{arxiv.2601.08358,
  title  = {Decodable but not structured: linear probing enables Underwater Acoustic Target Recognition with pretrained audio embeddings},
  author = {Hilde I. Hummel and Sandjai Bhulai and Rob D. van der Mei and Burooj Ghani},
  journal= {arXiv preprint arXiv:2601.08358},
  year   = {2026}
}