AgriChat:面向农业图像理解的多模态大语言模型
计算机视觉与模式识别
2026-03-19 v1 人工智能
摘要
多模态大语言模型(MLLM)在农业领域的部署目前受到关键权衡的制约:现有文献缺乏用于稳健模型开发和评估的大规模农业数据集,而当前最先进的模型缺乏必要的验证后域专长以跨越多样化的分类学。为解决这些挑战,我们提出了视觉到验证知识(V2VK)管道,一种集成视觉描述与 web 增强科学检索的自主生成注释框架,用于自动生成 AgriMM 基准数据集,通过将训练数据锚定在验证的植物病理文献中以消除生物误认。AgriMM 基准包含超过 3000 个农业类别和 60.7 万个 VQA,涵盖细粒度植物种识别、植物病症识别、作物计数和成熟度评估等多个任务。依托这一可验证数据,我们提出了 AgriChat,一种专用的 MLLM,能够在数千个农业类别上呈现广泛知识,提供详尽的农业评估和解释。在多样化任务、数据集和评估条件下的广泛评估表明,AgriChat 在其他开源模型中表现出优越性能,包括内部和外部基准测试。结果表明,保持视觉细节并结合 web 验证知识构成了通向稳健可信农业 AI 的可靠路径。代码和数据集已公开于 https://github.com/boudiafA/AgriChat
引用
@article{arxiv.2603.16934,
title = {AgriChat: A Multimodal Large Language Model for Agriculture Image Understanding},
author = {Abderrahmene Boudiaf and Irfan Hussain and Sajid Javed},
journal= {arXiv preprint arXiv:2603.16934},
year = {2026}
}