从无人机遥感图像到作物表型推理:面向植物表型的多模态大语言模型基准
计算机视觉与模式识别
2026-04-14 v1 人工智能
计算与语言
摘要
为提高作物遗传学中的高通量、有效且全面的表型鉴定是关键前提。虽然这些任务传统上是手动完成的,但近期在多模态基础模型,特别是视觉语言模型 (VLM) 的快速发展,使得更自动化和稳健的表型分析成为可能。然而,植物科学仍然是基础模型面临的尤为挑战性的领域,因为它需要特定的领域知识、精细的视觉解释以及复杂的生物学和农业推理。为此,我们开发了 PlantXpert,一个用于大豆和棉花表型的证据导向多模态推理基准。我们的基准提供了一个结构化且可复现的框架,用于VLM的农业适应性,并可实现基础模型与其领域适应版本之间的受控比较。我们构建了一个包含385个数字图像和3000多条基准样本的数据集,涵盖关键植物科学领域,包括疾病、害虫防治、杂草管理和产量。该基准可以评估包括视觉专业知识、定量推理和多步骤农业推理在内的多种能力。我们评估了11个最新的VLM。结果表明,特定任务的微调在准确率上带来了显著的提升,模型如 Qwen3-VL-4B 和 Qwen3-VL-30B 达到最高可达78%。与此同时,模型规模的提升在一定容量之后的收益递减,跨大豆和棉花的泛化仍然不均衡,定量推理和生物学导向的推理仍然面临重大挑战。这些发现表明,PlantXpert 可以作为评估证据导向农业推理以及推动植物科学中多模态模型发展的基础。
引用
@article{arxiv.2604.09907,
title = {From UAV Imagery to Agronomic Reasoning: A Multimodal LLM Benchmark for Plant Phenotyping},
author = {Yu Wu and Guangzeng Han and Ibra Niang Niang and Francia Ravelombola and Maiara Oliveira and Jason Davis and Dong Chen and Feng Lin and Xiaolei Huang},
journal= {arXiv preprint arXiv:2604.09907},
year = {2026}
}
备注
In review