AgriChain:面向可解释农业视觉语言模型的专家验证推理,具可视化 grounding
计算机视觉与模式识别
2026-04-10 v1
摘要
准确且可解释的植物病害诊断是视觉语言模型 (VLM) 在实际农业领域面临的重大挑战。我们提出 AgriChain,一个约由 11,000 张经专家精选的叶片图像构成的数据集,涵盖多种作物与多种病原体,每张图像配有 (i) 病害标签、(ii) 校准置信度分数 (High/Medium/Low),以及 (iii) 经专家验证的链式思维 (CoT) 推理 rationale。首先由 GPT-4o 生成草稿解释,再由专业农业工程师依据标准描述符 (如病灶颜色、边缘、分布) 进行验证。我们在 AgriChain 上微调 Qwen2.5-VL-3B,得到专门模型 AgriChain-VL3B,用于联合预测病害并生成视觉关联推理。在 1,000 张测试集上,CoT 监督模型实现 73.1% 的 Top-1 准确率 (宏平均 F1 = 0.466;加权 F1 = 0.655),超越 Gemini 1.5 Flash、Gemini 2.5 Pro 和 GPT-4o Mini 等强大基线。生成的解释与专家推理高度一致,始终引用关键视觉线索。这些发现表明,专家验证的推理监督显著提升了准确率和可解释性,弥合了通用多模态模型与人类专家 expertise 之间的鸿沟,推动了面向可持续农业的可信赖、全球可部署的 AI 系统。数据集和代码已公开:https://github.com/hazzanabeel12-netizen/agrichain
引用
@article{arxiv.2604.07814,
title = {AgriChain Visually Grounded Expert Verified Reasoning for Interpretable Agricultural Vision Language Models},
author = {Hazza Mahmood and Yongqiang Yu and Rao Anwer},
journal= {arXiv preprint arXiv:2604.07814},
year = {2026}
}
备注
9 pages