中文

大型多模态模型能否理解农业场景?基于 AgroMind 的基准测试

计算机视觉与模式识别 2025-08-14 v3 人工智能

摘要

大型多模态模型 (LMM) 已在各类领域展现出强大的能力,但针对农业遥感 (RS) 的综合性基准测试仍寥寥无几。现有针对农业 RS 场景设计的基准测试存在显著局限,主要体现在数据集场景多样性不足和任务设计过于简化。为弥合这一差距,本文引入 AgroMind,一个覆盖四个任务维度的综合性农业遥感基准测试,包括空间感知、目标理解、场景理解和场景推理,共计 13 种任务类型,从作物识别和健康监测到环境分析等。我们通过整合八个公开数据集和一个私有农田图块数据集,构建高质量评估集,包含 27,247 对 QA 配对和 19,615 张图像。该流程包括多源数据预处理,包括收集、格式标准化和标注细化。随后通过系统定义任务,生成与农业相关的多样化问题集合。最后使用 LMM 进行推理,生成响应并进行详细检验。我们在 AgroMind 上评估了 20 个开源 LMM 和 4 个闭源模型。实验结果显示,尤其在空间推理和细粒度识别方面,LMM 性能存在显著差距,值得注意的是,人类水平在多个领先开源 LMM 之后跟上。通过建立农业 RS 的标准化评估框架,AgroMind 揭示了 LMM 在领域知识方面的局限性,并为未来工作指出了关键挑战。数据和代码可在 https://rssysu.github.io/AgroMind/ 访问获取。

关键词

引用

@article{arxiv.2505.12207,
  title  = {Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind},
  author = {Qingmei Li and Yang Zhang and Zurong Mai and Yuhang Chen and Shuohong Lou and Henglian Huang and Jiarui Zhang and Zhiwei Zhang and Yibin Wen and Weijia Li and Haohuan Fu and Jianxi Huang and Juepeng Zheng},
  journal= {arXiv preprint arXiv:2505.12207},
  year   = {2025}
}