中文

生成对数据集偏移鲁棒的浮游生物分类器

计算机视觉与模式识别 2024-01-26 v1 机器学习

摘要

现代浮游生物高通量监测依赖于深度学习分类器对水生态系统中的物种进行识别。尽管名义性能令人满意,但一个重大挑战来自数据集偏移,这会导致部署期间性能下降。在我们的研究中,我们将ZooLake数据集与来自10个独立部署日的手动标注图像整合在一起,作为测试单元来基准测试分布外(OOD)性能。我们的分析揭示了分类器在分布内条件下表现良好,但在实际场景中遭遇显著失败的实例。例如,一个名义测试准确率为92%的MobileNet,其OOD准确率仅为77%。我们系统地研究了导致OOD性能下降的条件,并提出了一种预评估方法,用于识别分类新数据时的潜在陷阱,并精确定位OOD图像中对分类产生不利影响的特征。我们提出了一个三步流程:(i) 识别相对于名义测试性能的OOD退化,(ii) 对退化原因进行诊断分析,以及 (iii) 提供解决方案。我们发现,结合了针对OOD鲁棒性的定向增强、几何集成和基于旋转的测试时增强的BEiT视觉变换器集成模型,构成了最鲁棒的模型,我们称之为BEsT模型。它达到了83%的OOD准确率,错误主要集中在容器类上。此外,它对数据集偏移表现出较低的敏感性,并能很好地再现浮游生物丰度。我们提出的流程适用于通用的浮游生物分类器,前提是有合适的测试单元可用。通过识别关键缺陷并提供实用程序来强化模型以应对数据集偏移,我们的研究为开发更可靠的浮游生物分类技术做出了贡献。

关键词

引用

@article{arxiv.2401.14256,
  title  = {Producing Plankton Classifiers that are Robust to Dataset Shift},
  author = {Cheng Chen and Sreenath Kyathanahally and Marta Reyes and Stefanie Merkli and Ewa Merz and Emanuele Francazi and Marvin Hoege and Francesco Pomati and Marco Baity-Jesi},
  journal= {arXiv preprint arXiv:2401.14256},
  year   = {2024}
}