多模态学习用于作物产量预测的内在可解释性
人工智能
2025-08-12 v1 机器学习
摘要
多模态学习使各种机器学习任务能够从多样化的数据源中受益,有效模拟现实世界应用中不同因素之间的相互作用,特别是在农业领域。尽管所涉及数据模态的异构性可能需要设计复杂的架构,但模型可解释性往往被忽视。在本研究中,我们利用基于 Transformer 的模型的内在可解释性来解释多模态学习网络,重点关注子田块级别的作物产量预测任务。所使用的大规模数据集涵盖了多种作物、区域和年份,包含四种不同的输入模态:多光谱卫星和天气时间序列、地形高程图以及土壤属性。基于自注意力机制,我们使用两种方法估计特征归因,即注意力展开(AR)和通用注意力(GA),并将其性能与基于 Shapley 的模型无关估计——Shapley 值采样(SVS)进行评估。此外,我们提出了加权模态激活(WMA)方法来评估模态归因,并将其与 SVS 归因进行比较。我们的结果表明,基于 Transformer 的模型优于其他架构,具体而言,在子田块和田块级别上 R² 分数分别高出 0.10 和 0.04。AR 被证明提供了更稳健和可靠的时间归因,通过定性和定量评估得到证实,优于 GA 和 SVS 值。利用作物物候阶段信息来解释解释结果,并结合已建立的农学知识。此外,模态归因揭示了两种方法之间不同的模式。
引用
@article{arxiv.2508.06939,
title = {Intrinsic Explainability of Multimodal Learning for Crop Yield Prediction},
author = {Hiba Najjar and Deepak Pathak and Marlon Nuske and Andreas Dengel},
journal= {arXiv preprint arXiv:2508.06939},
year = {2025}
}