中文

PlantVillageVQA:面向植物科学的视觉-语言模型基准测试数据集

计算机视觉与模式识别 2025-09-01 v2 人工智能 机器学习

摘要

PlantVillageVQA 是一个大型视觉问题答案(VQA)数据集,源自广泛使用的 PlantVillage 图像语料库。它旨在推动面向农业决策和分析的视觉-语言模型的开发与评估。PlantVillageVQA 数据集包含 193,609 对高质量的问答(QA)配对,基于 55,448 张涵盖 14 种作物物种和 38 种病虫害情况的图像。问题按认知复杂性分为 3 级,并分为 9 个不同类别。每个问题类别均遵循专家指导并通过自动两阶段管道生成:(1)基于图像元数据的模板化 QA 合成,(2)多阶段语言重构。该数据集经过领域专家反复审阅,以确保科学准确性和相关性。最终数据集使用三种最先进的模型进行质量评估。我们的目标是提供一个公开可用、标准化且经专家验证的数据库,以提高植物病害诊断准确性,推动农业领域的科学研究。该数据集将在 https://huggingface.co/datasets/SyedNazmusSakib/PlantVillageVQA 上开源。

关键词

引用

@article{arxiv.2508.17117,
  title  = {PlantVillageVQA: A Visual Question Answering Dataset for Benchmarking Vision-Language Models in Plant Science},
  author = {Syed Nazmus Sakib and Nafiul Haque and Mohammad Zabed Hossain and Shifat E. Arman},
  journal= {arXiv preprint arXiv:2508.17117},
  year   = {2025}
}

备注

17 pages, 15 figures and Submittd to Nature Scientific Data