SPROUT:面向农业视觉的可扩展扩散基础模型
计算机视觉与模式识别
2026-03-31 v1
摘要
视觉基础模型 (VFM) 通过在大规模无标签数据上预训练已在通用计算机视觉任务中取得显著成功,但通常在应用到农业领域时存在显著的域间差距。在此背景下,我们引入 (calable lant epresentation model via pen-field nsupervised raining),一个多作物、多任务的农业基础模型,通过扩散去噪进行预训练。SPROUT 利用无 VAE 的像素空间扩散转换器通过去噪学习丰富且结构感知的表示,从而实现高效的端到端训练。我们在由 260 万张高质量农业图像组成的精选数据集上进行预训练,涵盖多种作物、生长阶段和环境。广泛的下游任务实验表明,SPROUT 在各类下游任务上 consistently 优于最先进的 web 预训练模型和农业基础模型,同时所需的预训练成本显著降低。代码和模型已公开于 https://github.com/UTokyo-FieldPhenomics-Lab/SPROUT。
引用
@article{arxiv.2603.27519,
title = {SPROUT: A Scalable Diffusion Foundation Model for Agricultural Vision},
author = {Shuai Xiang and Wei Guo and James Burridge and Shouyang Liu and Hao Lu and Tokihiro Fukatsu},
journal= {arXiv preprint arXiv:2603.27519},
year = {2026}
}