AgriGPT-VL:农业视觉语言理解套件
计算与语言
2025-12-09 v3
摘要
尽管多模态大语言模型取得了快速进展,但农业应用仍受限于缺乏领域定制模型、精心挑选的视觉语言语料库以及严格的评估。为此,我们提出了AgriGPT-VL套件,一个用于农业的统一多模态框架。我们的贡献有三方面:首先,我们引入了Agri-3M-VL,据我们了解是目前最大的农业视觉语言语料库,通过可扩展的多智能体数据生成器进行挑选;它包含100万张图像-文本对、200万张图像- grounding VQA 对、5万个专家水平 VQA 实例和15000个 GRPO 强化学习样本。其次,我们开发了AgriGPT-VL,一个针对农业的视觉语言模型,通过文本 grounding、多模态浅层/深层对齐和 GRPO 精炼的渐进式课程进行训练。该方法在保持文本-only 能力的同时实现了强大的多模态推理。第三,我们建立了AgriBench-VL-4K,一个紧凑且具挑战性的评估套件,包含开放式和图像- grounding 问题,并配有多指标评估和 LLM-as-a-judge 框架。实验表明,AgriGPT-VL 在 AgriBench-VL-4K 上超越了领先的通用 VLM,实现更高的两两获胜率。同时,它在 text-only AgriBench-13K 上表现竞争,语言能力未见明显下降。消融研究进一步确认了我们对齐和 GRPO 精炼阶段的持续性提升。我们将开源所有资源,以支持低资源农业环境中的可重复研究和部署。
引用
@article{arxiv.2510.04002,
title = {AgriGPT-VL: Agricultural Vision-Language Understanding Suite},
author = {Bo Yang and Yunkui Chen and Lanfei Feng and Yu Zhang and Xiao Xu and Jianyu Zhang and Nueraili Aierken and Runhe Huang and Hongjian Lin and Yibin Ying and Shijian Li},
journal= {arXiv preprint arXiv:2510.04002},
year = {2025}
}