中文

面向农业物联网中设备视觉系统的注意力与逻辑蒸馏的混合知识传递

计算机视觉与模式识别 2025-04-24 v1 人工智能 机器学习

摘要

将深度学习应用集成到农业物联网系统面临严重挑战:在保持Vision Transformer(ViT)高准确率的同时,又要满足资源受限边缘设备的效率需求。大型Transformer模型如Swin Transformer在通过捕获全局-局部依赖项实现植物病害分类方面表现出色。然而,其计算复杂度(34.1 GFLOPs)限制了应用并使其在实时设备推理时不可行。轻量级模型如MobileNetV3和TinyML适用于设备推理,但缺乏对精细病害检测所需的空间推理能力。为填补这一差距,我们提出一种混合知识蒸馏框架,通过Swin Transformer教师模型将logit和注意力知识同步传递给MobileNetV3学生模型。我们的方法包括引入自适应注意力对齐以解决跨架构不匹配(分辨率、通道数),以及优化双损失函数以同时优化类别概率和空间注意力。在lantVillage-Tomato数据集(18,160张图像)上,蒸馏后的MobileNetV3准确率达92.4%,相当于Swin-L的95.9%,在PC上计算开销降低95%,在智能手机CPU上推理延迟降至<82%(PC CPU为23ms,智能手机CPU为86ms/图像)。关键创新包括面向IoT的验证指标(13 MB内存,0.22 GFLOPs)和动态分辨率匹配注意力图。对比实验显示,相较于独立CNN和现有蒸馏方法,本方法在MobileNetV3基线上实现了3.5%的准确率提升。显著的是,本工作推动了精密农业中实时、高效的作物监测,证明了我们可在边缘设备上实现ViT级诊断精度。代码和模型将在接受后公开。

关键词

引用

@article{arxiv.2504.16128,
  title  = {Hybrid Knowledge Transfer through Attention and Logit Distillation for On-Device Vision Systems in Agricultural IoT},
  author = {Stanley Mugisha and Rashid Kisitu and Florence Tushabe},
  journal= {arXiv preprint arXiv:2504.16128},
  year   = {2025}
}

备注

12 pages and 4 figures