AgroNVILA:面向多视角农业多模态大语言模型的感知-推理解耦
计算机视觉与模式识别
2026-03-17 v1 人工智能
摘要
农业多模态推理需要对从地面近拍到无人机和卫星遥感图像的各种尺度进行稳健的空间理解。现有的多模态大语言模型(MLLM)存在显著的“陆地中心”偏见,导致在复杂农业规划中出现尺度混淆和逻辑漂移。为此,我们引入了首个大规模 AgroOmni(288K)数据集,旨�捕捉现代精密农业中多样化的空间拓扑结构和尺度。基于该数据集,我们提出了 AgroNVILA,一种 MLLM,利用 novel 感知-推理解耦(PRD)架构。在感知侧,我们引入了视角条件元网络(VCMN),将宏观空间上下文注入视觉标记,最小计算开销即可解决尺度歧义。在推理侧,农业感知相对策略优化(ARPO)利用强化学习将模型决策与专家农业逻辑对齐,防止统计捷径。广泛的实验表明,AgroNVILA 在多高度农业推理方面超越了最先进的 MLLM,实现了显著改进(+15.18%),体现了其在整体农业空间规划方面的稳健能力。
引用
@article{arxiv.2603.14342,
title = {AgroNVILA: Perception-Reasoning Decoupling for Multi-view Agricultural Multimodal Large Language Models},
author = {Jiarui Zhang and Junqi Hu and Zurong Mai and Yuhang Chen and Shuohong Lou and Henglian Huang and Lingyuan Zhao and Jianxi Huang and Yutong Lu and Haohuan Fu and Juepeng Zheng},
journal= {arXiv preprint arXiv:2603.14342},
year = {2026}
}