精准农业中的视觉 Transformer:一项综合性综述
计算机视觉与模式识别
2025-12-16 v4 人工智能
摘要
植物病害检测是现代农业的关键环节,在维持作物健康和提高整体产量方面发挥着重要作用。传统方法虽仍有价值,但往往依赖人工检查或常规机器学习技术,二者在可扩展性和准确性方面均存在局限。近年来,视觉 Transformer(Vision Transformers, ViTs)作为一种有前景的替代方案崭露头角,具有更好地处理长程依赖关系以及在视觉任务中具备更强可扩展性等优势。本综述探讨了 ViTs 在精准农业中的应用,涵盖了一系列任务。我们首先介绍 ViTs 的基础架构,并讨论其从自然语言处理(NLP)到计算机视觉的过渡。讨论内容包括传统模型(如卷积神经网络(CNN))中的归纳偏置概念,以及 ViTs 如何缓解这些偏置。我们对近期文献进行了全面综述,重点关注关键方法、数据集和性能指标。本研究还包括 CNN 与 ViTs 的对比分析,以及对混合模型和性能增强方法的综述。我们讨论了数据需求、计算开销和模型可解释性等技术挑战,并提出了相应的潜在解决方案。最后,我们概述了未来的研究方向和技术进步,这些方向和进步有望进一步推动 ViTs 在实际农业场景中的集成。本研究旨在为从业者和研究人员提供对 ViTs 即将如何变革智慧农业和精准农业的更深层次理解。
引用
@article{arxiv.2504.21706,
title = {Vision Transformers in Precision Agriculture: A Comprehensive Survey},
author = {Saber Mehdipour and Seyed Abolghasem Mirroshandel and Seyed Amirhossein Tabatabaei},
journal= {arXiv preprint arXiv:2504.21706},
year = {2025}
}