中文

自动融合多模态深度学习用于植物识别

计算机视觉与模式识别 2025-08-06 v3 人工智能 机器学习

摘要

植物分类对于生态保护和农业生产力至关重要,增强我们对植物生长动态的理解并有助于物种保护。深度学习技术的出现通过实现自主特征提取,显著减少了对人工专业知识的依赖,从而彻底改变了这一领域。然而,传统的深度学习模型通常仅依赖单一数据源,无法全面捕捉植物物种的完整生物多样性。最近的研究转向多模态学习,通过整合多种数据类型来克服这一限制,从而丰富植物特征的表示。这种转变带来了确定模态融合最佳点的挑战。在本文中,我们介绍了一种开创性的基于多模态深度学习的植物分类方法,具有自动模态融合功能。利用多模态融合架构搜索,我们的方法将来自多个植物器官(花、叶、果实和茎)的图像整合到一个统一的模型中。为了解决多模态数据集的缺乏,我们贡献了Multimodal-PlantCLEF,这是PlantCLEF2015数据集的重构版本,专为多模态任务定制。我们的方法在Multimodal-PlantCLEF的979个类别上达到了82.61%的准确率,超越了最先进的方法,并比晚期融合高出10.33%。通过引入多模态dropout,我们的方法对缺失模态表现出强大的鲁棒性。我们使用标准性能指标和McNemar检验在既定基准上验证了我们的模型,进一步强调了其优越性。

关键词

引用

@article{arxiv.2406.01455,
  title  = {Automatic Fused Multimodal Deep Learning for Plant Identification},
  author = {Alfreds Lapkovskis and Natalia Nefedova and Ali Beikmohammadi},
  journal= {arXiv preprint arXiv:2406.01455},
  year   = {2025}
}