BioBench:超越 ImageNet 的科学 ML 基准蓝图
计算机视觉与模式识别
2025-11-21 v1
摘要
ImageNet-1K 线性探针迁移准确率仍是视觉表征质量的默认代理指标,但已不再预测科学图像上的性能。我们在 46 个现代视觉模型检查点中发现,ImageNet top-1 准确率仅解释生态学任务中方差的 34%,并在 30% 的模型上误排位(准确率超过 75%)。我们提出 BioBench,一个捕捉 ImageNet 所忽视的生态视觉基准。BioBench 统一了 9 个公开释放的、以应用为导向的任务、4 个生物分类学王国和 6 种获取模态(无人机 RGB、网页视频、显微镜图像、原位和标本照片、相机捕获帧),总计 310 万张图像。通过单一的 Python API 下载数据、对冻结的 backbone 进行轻量级分类器拟合,并报告类别平衡的宏 F1 分数(以及针对 FishNet 和 FungiCLEF 的领域指标);在 A6000 GPU 上评估 ViT-L 模型仅需 6 小时。BioBench 为计算机视觉生态学提供了新的信号,并为构建可靠 AI-for-science 基准的任何领域提供了模板配方。代码和预测可在 https://github.com/samuelstevens/biobench 和 https://samuelstevens.me/biobench 获取。
引用
@article{arxiv.2511.16315,
title = {BioBench: A Blueprint to Move Beyond ImageNet for Scientific ML Benchmarks},
author = {Samuel Stevens},
journal= {arXiv preprint arXiv:2511.16315},
year = {2025}
}
备注
Accepted at the 3rd Imageomics Workshop at NeurIPS 2025