面向高效时空植被像素分类的 Vision Transformer 研究
计算机视觉与模式识别
2026-05-04 v1
摘要
植物现象学——即研究周期性生命活动事件的学科——对于理解生态系统动力学及其对气候变化影响的响应至关重要。虽然无人机 (UAV) 和近表面相机能够实现高分辨率监测,但跨时间段的植物种属识别仍面临计算挑战。当前方法,特别是多时序卷积神经网络 (CNN),依赖刚性多分支架构,随时间序列长度扩展效果不佳,且需要较大的空间上下文窗口。在本文中,我们对 Vision Transformer (ViT) 在高效时空植被像素分类中的应用进行了广泛研究。我们进行了全面的消融研究,分析了七个关键设计维度,包括:(i) 数据归一化;(ii) 光谱排列;(iii) 边界处理;(iv) 空间上下文窗口的形状与大小;(v) 分词策略;(vi) 位置编码;以及 (vii) 特征聚合策略。我们的方法在来自巴西塞尔多生态区的两个数据集上进行评估:Serra do Cip\'o(航空航天图像)和 Itirapina(近表面图像)。实验结果表明,我们的 ViT 方法在计算效率上实现了显著提升,同时保持了具竞争力的分类性能。值得注意的是,我们的 ViT 将浮点运算量 (FLOPs) 降低了一个数量级,并且参数复杂度随时间序列长度保持恒定,而 CNN 基线则呈线性增长。我们的发现确认,ViT 是资源受限植被现象学监测系统中稳健、可扩展的解决方案。
引用
@article{arxiv.2605.00296,
title = {Efficient Spatio-Temporal Vegetation Pixel Classification with Vision Transformers},
author = {Alan Gomes and Anderson Gonçalves and Samuel Felipe dos Santos and Nathan Felipe Alves and Magna Soelma Beserra de Moura and Bruna de Costa Alberton and Leonor Patricia C. Morellato and Ricardo da Silva Torres and Jurandy Almeida},
journal= {arXiv preprint arXiv:2605.00296},
year = {2026}
}