中文

正-未标记主动学习以 Curate Orca Resident Interpretation 数据集

机器学习 2026-04-14 v2 声音

摘要

本工作报告了迄今为止规模最大的 Southern Resident Killer Whale(SRKW)声学数据整理,同时包含其环境中的其他海洋哺熟动物。我们系统性地搜索 SRKW 栖息地内所有可用的公共档案水声数据(超过 30 年的音频数据)。该搜索采用弱监督、正-未标记、主动学习策略,以识别所有海洋哺熟动物实例。得到的基于 Transformer 的存在或缺失分类器在 4 个专家标注数据集中相对于最先进的分类器在准确率和能源效率方面均表现出优异性能。WHISPER 检测模型系列的 AUROC 分别为 0.58(0.48-0.67)至 0.77(0.63-0.93),取决于 WHISPER-tiny 至 WHISPER-large-v3。我们的多类物种分类器在 DCLDE-2026 数据集上获得的 Top-1 准确率为 53.2%(11 类训练类别,4 类测试类别),而生态型分类器获得的 Top-1 准确率为 33.6%(4 类训练类别,5 类测试类别)。我们整理了 919 小时 SRKW 数据、230 小时 Bigg's orca 数据、1374 小时来自未标注生态类型的 orca 数据、1501 小时 humpback 数据、88 小时 sea lion 数据、246 小时太平洋白尾海豚数据,以及超过 784 小时的未指定海洋哺熟动物数据。该 SRKW 数据集的规模超过 DCLDE-2026、Ocean Networks Canada 和 OrcaSound 的总和。整理后的物种标签以 CC-BY 4.0 许可证提供,相应的音频数据则以原始所有者的许可证提供。该数据集的全面性使其适用于无监督机器翻译、栖息地使用调查以及该濒危生态类型的保育工作。

关键词

引用

@article{arxiv.2602.09295,
  title  = {Positive-Unlabelled Active Learning to Curate a Dataset for Orca Resident Interpretation},
  author = {Bret Nestor and Bohan Yao and Jasmine Moore and Jasper Kanes},
  journal= {arXiv preprint arXiv:2602.09295},
  year   = {2026}
}