中文

基于迁移学习的可解释视觉 Transformer 用于高效旱情应激识别

计算机视觉与模式识别 2026-01-30 v3 人工智能 新兴技术 机器学习

摘要

早期检测旱情应激对于在旱情影响不可逆转之前采取措施减少作物损失至关重要。非侵入性成像技术捕捉对旱情应激的细微形态和生理变化,这些成像数据为机器学习方法识别旱情应激提供了宝贵资源。虽然卷积神经网络 (CNN) 应用广泛,但视觉 Transformer (ViT) 作为捕捉长程依赖和复杂空间关系的替代方案,能够增强对细微旱情指示器的检测。我们提出了一个基于 ViT 的可解释深度学习管道,用于利用航空图像检测土豆作物的旱情应激。我们应用了两种不同的方法:一种是将 ViT 与支持向量机 (SVM) 的协同组合,其中 ViT 从航空图像中提取复杂的空间特征,SVM 将作物分类为受应激或健康;另一种是使用包含专用分类层的端到端 ViT 直接检测旱情应激。我们的关键发现通过可视化注意力图解释了 ViT 模型的决策过程,这些图表明了 ViT 模型关注的航空图像中的特定空间特征作为旱情应激特征。我们的发现表明,所提出的方法不仅在旱情识别中实现了高准确率,而且揭示了与旱情应激相关的各种细微植物特征。这为农民提供了一个稳健且可解释的旱情监测解决方案,以便做出明智的决策以改进作物管理。

关键词

引用

@article{arxiv.2407.21666,
  title  = {An explainable vision transformer with transfer learning based efficient drought stress identification},
  author = {Aswini Kumar Patra and Ankit Varshney and Lingaraj Sahoo},
  journal= {arXiv preprint arXiv:2407.21666},
  year   = {2026}
}

备注

33 pages, 7 figures, 8 tables