中文

利用视觉语言模型处理特定农业任务

机器学习 2025-03-04 v2 计算机视觉与模式识别

摘要

随着视觉语言模型(VLMs)日益普及于农业从业者和专家手中,评估其在专业任务中的潜力的需求日益增长。我们提出了 AgEval,一个用于评估视觉语言模型在植物应激表型任务中能力的全面基准测试,为解决农业领域标注数据有限的挑战提供了解决方案。我们的研究探索了如何仅通过少量标注示例即可将通用视觉语言模型应用于特定领域任务,提供了关于其行为和适应性的见解。AgEval 涵盖 12 种多样化的植物应激表型任务,评估了 Claude、GPT、Gemini 和 LLaVA 等最先进模型在零-shot 和 few-shot 上下文学习中的性能。我们的结果表明,视觉语言模型能够快速适应专业任务,表现最佳的模型在 8-shot 识别中 F1 分数从 46.24% 提升至 73.37%。为量化不同类别之间的性能差异,我们引入了系数变异(CV)等指标,揭示了视觉语言模型的训练对不同类别的影响,CV 范围从 26.02% 到 58.03%。我们还发现,战略性地选择示例可以增强模型的可靠性,精确的类别示例平均可使 F1 分数提高 15.38%。AgEval 为评估视觉语言模型在农业应用中的性能提供了框架,为未来的评估提供了有价值的基准。我们的发现表明,视觉语言模型在仅通过少量 few-shot 示例的情况下,作为植物应激表型中传统专用模型的可行替代方案展现出了潜力,同时也指出了进一步优化的领域。结果和基准细节可在:https://github.com/arbab-ml/AgEval 查阅。

关键词

引用

@article{arxiv.2407.19617,
  title  = {Leveraging Vision Language Models for Specialized Agricultural Tasks},
  author = {Muhammad Arbab Arshad and Talukder Zaki Jubery and Tirtho Roy and Rim Nassiri and Asheesh K. Singh and Arti Singh and Chinmay Hegde and Baskar Ganapathysubramanian and Aditya Balu and Adarsh Krishnamurthy and Soumik Sarkar},
  journal= {arXiv preprint arXiv:2407.19617},
  year   = {2025}
}

备注

Published at WACV 2025