视觉 Transformer 集成作为生态学中自动分类的新范式
计算机视觉与模式识别
2023-02-07 v3 机器学习
摘要
监测生物多样性对于管理和保护自然资源至关重要。在大时间或空间尺度上收集生物图像是一种有前景的的自然生态系统生物多样性监测手段,可在对环境影响最小的情况下提供大量数据。深度学习模型目前被用于自动将生物分类为分类单元。然而,这些分类器的不精确性引入了难以控制的测量噪声,会显著妨碍数据的分析与解释。{我们通过数据高效图像 Transformer (DeiT) 的集成克服了这一局限,其不仅易于训练和实现,而且显著优于}先前的最先进(SOTA)水平。我们在十个来源各异的生态成像数据集上验证了结果,范围从浮游生物到鸟类。在所有数据集上,我们都达到了新的 SOTA,相对于先前 SOTA 的错误率降低范围为 29.35% 至 100.00%,且常常达到接近完美分类的性能。DeiT 集成表现更优并非因为单模型性能更优,而是由于独立模型预测间重叠更小且 top-1 概率更低。这增加了集成的收益,尤其在使用几何平均结合个体学习器时。虽然我们仅在生物多样性图像数据集上测试了方法,但我们的方法是通用的,可应用于任何类型的图像。
引用
@article{arxiv.2203.01726,
title = {Ensembles of Vision Transformers as a New Paradigm for Automated Classification in Ecology},
author = {S. Kyathanahally and T. Hardeman and M. Reyes and E. Merz and T. Bulas and P. Brun and F. Pomati and M. Baity-Jesi},
journal= {arXiv preprint arXiv:2203.01726},
year = {2023}
}
备注
To appear in Scientific Reports