面向农业病害分类的领域特定自监督预训练:一项分层视觉 Transformer 研究
计算机视觉与模式识别
2026-01-21 v1 机器学习
摘要
我们使用分层视觉 Transformer 研究了领域特定自监督预训练对农业病害分类的影响。我们的关键发现是,仅在 3,000 张无标注农业图像上进行 SimCLR 预训练即可带来 +4.57% 的准确率提升——超过了分层架构设计带来的 +3.70% 增益。至关重要的是,我们表明这种自监督学习(SSL)的收益与架构无关:将相同的预训练应用于 Swin-Base 带来 +4.08% 的提升,应用于 ViT-Base 带来 +4.20% 的提升,这证实了从业者应优先考虑领域数据收集而非架构选择。使用 HierarchicalViT(HVT,一种 Swin 风格的分层 Transformer),我们在三个数据集上进行了评估:Cotton Leaf Disease(7 类,90.24%)、PlantVillage(38 类,96.3%)和 PlantDoc(27 类,87.1%)。在参数量匹配的情况下,HVT-Base(78M)达到了 88.91%,而 Swin-Base(88M)为 87.23%,提升了 +1.68%。为了确保部署的可靠性,我们报告了校准分析,显示 HVT 达到了 3.56% 的 ECE(温度缩放后为 1.52%)。代码:https://github.com/w2sg-arnav/HierarchicalViT
引用
@article{arxiv.2601.11612,
title = {Domain-Specific Self-Supervised Pre-training for Agricultural Disease Classification: A Hierarchical Vision Transformer Study},
author = {Arnav S. Sonavane},
journal= {arXiv preprint arXiv:2601.11612},
year = {2026}
}
备注
11 pages, 4 figures, 9 tables