Tighnari:基于图特征与视觉骨干网络提取特征的分层交叉注意力多模态植物物种预测
计算机视觉与模式识别
2025-01-07 v1 人工智能
摘要
预测特定时空背景下的植物物种组成在生物多样性管理与保护以及改进物种识别工具方面发挥着重要作用。我们的工作利用了在欧洲特定时空背景下进行的 88,987 条植物调查记录。我们还使用相应的卫星图像、时间序列数据、气候时间序列以及其他栅格化的环境数据(如土地覆盖、人类足迹、生物气候和土壤变量)作为训练数据,训练模型预测 4,716 次植物调查的结果。我们提出了一种基于图结构的特征构建与结果校正方法。通过对比实验,我们为时间模态和图像模态的特征提取选择了性能最佳的骨干网络。在此过程中,我们构建了一个基于 Swin-Transformer Block 的骨干网络,用于提取时间 Cubes 特征。随后,我们设计了一种能够鲁棒融合多模态特征的分层交叉注意力机制。在训练过程中,我们采用基于微调的 10 折交叉融合方法,并使用 Threshold Top-K 方法进行后处理。消融实验证明了我们提出的解决方案流程带来的模型性能提升。
引用
@article{arxiv.2501.02649,
title = {Tighnari: Multi-modal Plant Species Prediction Based on Hierarchical Cross-Attention Using Graph-Based and Vision Backbone-Extracted Features},
author = {Haixu Liu and Penghao Jiang and Zerui Tao and Muyan Wan and Qiuzhuang Sun},
journal= {arXiv preprint arXiv:2501.02649},
year = {2025}
}
备注
CVPR GeolifeCLEF