中文

AgriDoctor:面向农业的多模态智能助手

计算机视觉与模式识别 2025-09-23 v1

摘要

准确的作物病害诊断对于可持续农业和全球粮食安全至关重要。现有方法主要依赖单模态模型,如基于图像的分类器和目标检测器,受限于其无法融合领域特定的农业知识,且缺乏对交互式、基于语言的理解支持。近期大语言模型(LLM)和大型视觉语言模型(LVLM)的进展为多模态推理开辟了新途径。然而,这些模型在农业语境中的表现仍有限,主要由于缺乏专业数据集和不足的领域适应。在本工作中,我们提出 AgriDoctor,一个模块化且可扩展的多模态框架,用于智能作物病害诊断和农业知识交互。作为首个将基于智能体的多模态推理引入农业领域的努力,AgriDoctor 提供了一种构建交互式且领域适应作物健康解决方案的新范式。它集成了五个核心组件:路由器、分类器、检测器、知识检索器和 LLM。为促进有效的训练和评估,我们构建 AgriMM,一个包含 40 万张标注病害图像、831 条专家精选知识条目和 30 万对双语提示用于意图驱动工具选择的综合性基准。大量实验表明,基于 AgriMM 训练的 AgriDoctor 在细粒度农业任务上显著优于最先进的 LVLM,确立了智能可持续农业应用的新范式。

关键词

引用

@article{arxiv.2509.17044,
  title  = {AgriDoctor: A Multimodal Intelligent Assistant for Agriculture},
  author = {Mingqing Zhang and Zhuoning Xu and Peijie Wang and Rongji Li and Liang Wang and Qiang Liu and Jian Xu and Xuyao Zhang and Shu Wu and Liang Wang},
  journal= {arXiv preprint arXiv:2509.17044},
  year   = {2025}
}