TreeFormers——面向森林砍伐驱动分类的 Vision Transformer 探索
计算机视觉与模式识别
2024-05-28 v1
摘要
本文针对森林砍伐这一关键议题,探索了利用视觉 Transformer(ViT)对印度尼西亚森林砍伐驱动因素进行分类的应用。为了回应这一迫切问题,我提出了一种利用 ViT 和机器学习技术的方法。我的算法的输入是 332x332 像素的卫星图像,我采用 ViT 架构预测森林砍伐驱动类别; grassland shrubland、other、plantation 或 smallholder agriculture。我的方法涉及在斯坦福大学机器学习小组的数据集上微调预训练的 ViT,并实验了旋转数据增强技术(以及其他技术)以及纵向数据嵌入以提高分类准确率。我还尝试了从头训练 ViT。结果表明相对于基线模型有显著改进,测试准确率达到 72.9%。我进行了全面的分析,包括错误模式和指标,以突出方法的优势和局限性。这项研究为通过先进计算机视觉技术解决森林砍伐挑战作出了贡献。
引用
@article{arxiv.2405.15989,
title = {TreeFormers -- An Exploration of Vision Transformers for Deforestation Driver Classification},
author = {Uche Ochuba},
journal= {arXiv preprint arXiv:2405.15989},
year = {2024}
}