中文

CT-CLIP:面向复杂环境下鲜果叶病识别的多模态融合框架

计算机视觉与模式识别 2025-10-27 v1 人工智能

摘要

在复杂的园区环境中,不同苹果叶病的表型异质性特征由于病斑之间的差异较大,给传统的多尺度特征融合方法带来挑战。这些方法仅集成由卷积神经网络(CNN)提取的多层特征,未能充分考虑局部特征与全局特征之间的关系。因此,本研究提出了一种名为 CNN-Transformer-CLIP(CT-CLIP)的多分支识别框架。该框架协同利用 CNN 提取局部病斑细节特征,同时使用 Vision Transformer 捕获全局结构关系。随后,自适应特征融合模块(AFFM)动态融合这些特征,实现局部与全局信息的最佳耦合,有效应对病斑形态和分布的多样性。此外,为缓解复杂背景的干扰并显著提升少样本条件下的识别精度,本研究提出了一种多模态图像-文本学习方法。通过利用预训练的 CLIP 模型权重,实现视觉特征与疾病语义描述之间的深度对齐。实验结果表明,CT-CLIP 在公开的苹果病 disease 数据集和自建数据集上分别实现了 97.38% 和 96.12% 的准确率,优于多个基线方法。该提出的 CT-CLIP 在识别农业疾病方面展现出强大的能力,在复杂环境条件下显著提升了识别精度,为自动化农业应用中的疾病识别提供了创新且实用的解决方案。

关键词

引用

@article{arxiv.2510.21346,
  title  = {CT-CLIP: A Multi-modal Fusion Framework for Robust Apple Leaf Disease Recognition in Complex Environments},
  author = {Lemin Liu and Fangchao Hu and Honghua Jiang and Yaru Chen and Limin Liu and Yongliang Qiao},
  journal= {arXiv preprint arXiv:2510.21346},
  year   = {2025}
}