用于高分辨率无人机图像中杂草与作物分类的视觉Transformer
计算机视觉与模式识别
2022-09-07 v2
摘要
作物与杂草监测是当今农业与食品生产的重要挑战。得益于数据采集与计算技术的最新进展,农业正演进为更智能、更精准的耕作,以满足高产优质作物生产的需求。无人机(UAV)图像中的分类与识别是作物监测的重要阶段。依赖卷积神经网络(CNN)的深度学习模型进展已在农业领域图像分类中取得高性能。尽管该架构成功,CNN仍面临诸多挑战,如高计算成本、需大量标注数据集等。自然语言处理的transformer架构可作为应对CNN局限的替代方案。利用自注意力范式,视觉Transformer(ViT)模型无需任何卷积操作即可取得有竞争力或更优的结果。本文中,我们通过ViT模型采用自注意力机制进行杂草与作物的植物分类:红甜菜、异型甜菜(绿叶)、欧芹与菠菜。我们的实验表明,在少量标注训练数据下,ViT模型优于最先进的基于CNN的模型EfficientNet与ResNet,ViT模型取得99.8%的顶尖准确率。
引用
@article{arxiv.2109.02716,
title = {Vision Transformers For Weeds and Crops Classification Of High Resolution UAV Images},
author = {Reenul Reedha and Eric Dericquebourg and Raphael Canals and Adel Hafiane},
journal= {arXiv preprint arXiv:2109.02716},
year = {2022}
}
备注
Compared to the last version of the article, we have added some experiments, that is the evaluation of the performances by varying the number of samples in the test and train sets