PestVL-Net:通过细粒度视觉-语言交互实现多模态害虫学习
计算机视觉与模式识别
2026-04-21 v1
摘要
有效的害虫识别和管理是可持续农业发展的关键。然而,在实际场景中收集害虫数据往往具有挑战性。与其他领域不同,害虫具有广泛的物种种类和复杂多样的形态特征。现有技术难以以细粒度方式建模害虫的关键视觉特征和高层次语义特征。这些限制阻碍了此类方法在实际农业场景中的实际应用。为解决这些关键挑战,我们提出了一种协同方法,集成PestVL-Net——一种新的视觉-语言框架,与两种多物种害虫数据集结合,以促进细粒度害虫学习。PestVL-Net的视觉路径采用循环加权键值(RWKV)架构,包含基于显著性引导的自适应窗口分区方案,以有效建模害虫的细粒度视觉特征。同时,语言组件通过利用多模态大语言模型(MLLM)先验,结合农业专家知识,并通过多模态链式思维(CoT)推理进行结构化,生成精确的害虫语义描述。这些互补的视觉和文本表征的深度融合,使细粒度的多模态害虫学习成为可能。对多个害虫数据集上的大规模实验评估验证了PestVL-Net的卓越性能,凸显了其在实际害虫管理中实际应用潜力。
引用
@article{arxiv.2604.17278,
title = {PestVL-Net: Enabling Multimodal Pest Learning via Fine-grained Vision-Language Interaction},
author = {Xueheng Li and Tao Hu and Ke Cao and Runsheng Qi and Huixin Zhang and Rui Li and Jie Zhang and Chengjun Xie},
journal= {arXiv preprint arXiv:2604.17278},
year = {2026}
}
备注
10 pages, 7 figures