Transformer 与卷积模型在昆虫细粒度分类中的比较
计算机视觉与模式识别
2023-07-24 v1 机器学习
摘要
细粒度分类因难以发现判别性特征而具有挑战性。当应用于同一分类学阶元内物种的识别时,该问题更加严重。这是因为物种常共享形态学特征,使其难以区分。我们考虑昆虫纲这一分类学阶元。昆虫的识别在生物多样性监测中至关重要,因为它们是许多生态系统基底的栖息者之一。公民科学正在出色地收集野外昆虫图像,使专家能够绘制各国改进的分布图。我们有数十亿张图像需要自动分类,深度神经网络算法是用于细粒度任务的主要探索技术之一。在 SOTA 上,深度学习算法领域极为丰硕,那么如何确定使用的算法?我们聚焦于蜻蜓目和鞘翅目,并提出一项初步比较研究,以分析计算机视觉中两种最知名的层结构:transformer 层与卷积层。我们比较了全 transformer 基的 T2TViT、全卷积基的 EfficientNet 以及混合的 ViTAE 的性能。我们在相同条件下评估三个模型按物种、按形态及性别、推理时间以及智能手机不平衡图像数据集上的整体性能。尽管我们观察到三类模型均具有高性能,我们的分析表明混合模型在准确率上优于全卷积基和全 transformer 基模型,而全 transformer 基模型在推理速度上优于其他模型,这些证明 transformer 对样本匮乏具有鲁棒性且在推理时更快。
引用
@article{arxiv.2307.11112,
title = {Comparison between transformers and convolutional models for fine-grained classification of insects},
author = {Rita Pucci and Vincent J. Kalkman and Dan Stowell},
journal= {arXiv preprint arXiv:2307.11112},
year = {2023}
}