中文

LeafNet:面向植物疾病基础视觉语言理解的大规模数据集与综合基准

计算机视觉与模式识别 2026-02-23 v3 人工智能

摘要

基础模型和视觉语言预训练显著推进了视觉语言模型(VLM),使其能够处理视觉和语言数据的多模态特征。然而,其在特定农业任务(如植物病理学)中的应用仍受限,主要由于缺乏大规模、综合性的多模态图像-文本数据集和基准。为此,我们引入 LeafNet,一个综合性的多模态数据集,以及LeafBench,一个用于系统性评估 VLM 在理解植物疾病方面能力的视觉问答基准。该数据集包含186,000张覆盖97个疾病类的叶片数字图像,配有元数据,生成13,950个涵盖六个关键农业任务的问答对。这些问题评估了植物病理学理解的 various aspects,包括视觉症状识别、分类学关系和诊断推理。对LeafBench数据集上的12种最先进 VLM 进行基准测试,我们揭示了其疾病理解能力之间的显著差异。我们的研究表明,性能在各任务间差异显著:二元健康-病害分类准确率超过90%,而细粒度病原体和物种识别准确率仍低于65%。直接比较视觉模型和 VLM,证明了多模态架构的关键优势:微调后的 VLM 在诊断精确度方面优于传统视觉模型,确认了将语言表示与视觉表示集成显著提升了诊断精度。这一发现突显了当前 VLM 在植物病理学应用中的关键缺口,强调LeafBench作为方法学进展和进展评估的严格框架的必要性。代码可在 https://github.com/EnalisUs/LeafBench 获取。

关键词

引用

@article{arxiv.2602.13662,
  title  = {LeafNet: A Large-Scale Dataset and Comprehensive Benchmark for Foundational Vision-Language Understanding of Plant Diseases},
  author = {Khang Nguyen Quoc and Phuong D. Dao and Luyl-Da Quach},
  journal= {arXiv preprint arXiv:2602.13662},
  year   = {2026}
}

备注

26 pages, 13 figures and 8 tables