中文

AgMMU:全面的农业多模态理解基准测试

计算机视觉与模式识别 2025-07-28 v2

摘要

我们提出了AgMMU,一个用于评估和推进视觉语言模型(VLM)在农业这一知识密集型领域中的具有挑战性的真实世界基准测试。与依赖众包提示的先前数据集不同,AgMMU源自116,231段日常种植者与USDA授权的合作社推广专家之间的真实对话。通过三阶段流程:自动化知识提取、问答生成和人工验证,我们构建了(i) AgMMU,一个包含746道选择题(MCQ)和746道开放式问题(OEQ)的评估集,以及(ii) AgBase,一个涵盖五种高风险农业主题的开发语料库,包含57,079条多模态事实:昆虫识别、物种识别、疾病分类、症状描述和管理指导。对12种主流VLM的基准测试揭示了细粒度感知和事实基础方面的显著差距。开源模型与专有模型之间存在巨大差距。在AgBase上的简单微调使开源模型在具有挑战性的OEQ上的性能平均提升高达11.6%,缩小了这一差距,也激励未来研究提出更好的从AgBase中进行知识提取和蒸馏的策略。我们希望AgMMU能激发农业AI开发中领域特定知识集成和可信决策支持的研究。

关键词

引用

@article{arxiv.2504.10568,
  title  = {AgMMU: A Comprehensive Agricultural Multimodal Understanding Benchmark},
  author = {Aruna Gauba and Irene Pi and Yunze Man and Ziqi Pang and Vikram S. Adve and Yu-Xiong Wang},
  journal= {arXiv preprint arXiv:2504.10568},
  year   = {2025}
}

备注

Project Website: https://agmmu.github.io/ Huggingface: https://huggingface.co/datasets/AgMMU/AgMMU_v1/