WisWheat:用于小麦管理的三层视觉语言数据集
计算机视觉与模式识别
2025-06-09 v1
摘要
小麦管理策略在决定产量方面发挥关键作用。传统的管理决策通常依赖于依赖劳动力的专家检查,这些检查成本高昂、主观且难以扩展。最近,视觉语言模型(VLMs)作为一种有前景的解决方案,旨在实现可扩展的数据驱动的管理支持。然而,由于缺乏领域特定知识,直接将 VLMs 应用于小麦管理任务会导致差异化和推理能力差,最终产生模糊甚至误导的管理建议。作为响应,我们提出 WisWheat,一个小麦特定数据集,具有三层设计以增强 VLMs 在小麦管理任务上的性能:(1)包含 47,871 组图像-标题对的基础预训练数据集,用于粗略适应 VLMs 至小麦形态学;(2)包含 7,263 组 VQA 风格图像-问题-答案三元组的定量数据集,用于量化特征测量任务;(3)包含 4,888 个样本的指令微调数据集,针对不同生育阶段的生物学和无机学应激诊断和管理计划。广泛的实验结果表明,在我们的训练数据集上对开源 VLMs(例如 Qwen2.5 7B)进行微调会导致显著的性能提升。具体而言,对我们小麦指令数据集进行微调的 Qwen2.5 VL 7B 在小麦应激和生长阶段对话任务中分别实现了 79.2% 和 84.6% 的准确率,甚至在准确率上超过了甚至是通用商业模型如 GPT-4o,以差距达 11.9% 和 34.6%。
引用
@article{arxiv.2506.06084,
title = {WisWheat: A Three-Tiered Vision-Language Dataset for Wheat Management},
author = {Bowen Yuan and Selena Song and Javier Fernandez and Yadan Luo and Mahsa Baktashmotlagh and Zijian Wang},
journal= {arXiv preprint arXiv:2506.06084},
year = {2025}
}