中文

用于可解释农作物病害视觉问答的两阶段多任务视觉-语言框架

计算机视觉与模式识别 2026-03-10 v2 计算与语言

摘要

用于农作物病害分析的视觉问答(VQA)需要准确的视觉理解和可靠的语言生成。在本工作中,我们提出了一个轻量级且可解释的视觉-语言框架,用于从叶片图像中识别农作物和病害。该方法将Swin Transformer视觉编码器与序列到序列语言解码器相集成。视觉编码器首先在多任务设置下针对植物和病害分类进行训练,然后在训练文本解码器时将其冻结,这构成了一种两阶段训练策略,增强了视觉表示学习和跨模态对齐。我们在大规模农作物病害领域多模态(CDDM)数据集上使用分类和自然语言生成指标对模型进行了评估。实验结果展示了近乎完美的识别性能,实现了99.94%的植物分类准确率和99.06%的病害分类准确率,以及优异的BLEU、ROUGE和BERTScore结果。无需微调,该模型即可良好泛化至外部PlantVillageVQA基准,在VQA任务中达到83.18%的微准确率。我们的轻量级设计在使用显著更少参数的同时,优于更大的视觉-语言基线。通过Grad-CAM和token级归因评估可解释性,为预测提供了可解释的视觉和文本证据。定性结果展示了在多样化用户驱动查询下的稳健性能,突出了任务特定视觉预训练和两阶段训练方法在农作物病害视觉问答中的有效性。所提出的Swin-T5模型的交互式演示已作为基于Gradio的应用程序公开提供,网址为 https://huggingface.co/spaces/Zahid16/PlantDiseaseVQAwithSwinT5,供社区使用。

关键词

引用

@article{arxiv.2601.05143,
  title  = {A Two-Stage Multitask Vision-Language Framework for Explainable Crop Disease Visual Question Answering},
  author = {Md. Zahid Hossain and Most. Sharmin Sultana Samu and Md. Rakibul Islam and Md. Siam Ansary},
  journal= {arXiv preprint arXiv:2601.05143},
  year   = {2026}
}

备注

Preprint, manuscript is under review