中文

基础模型何时有效?基于多光谱遥感影像像素级分类的适用性分析

计算机视觉与模式识别 2024-04-19 v1 人工智能 机器学习

摘要

基础模型,即非常大的深度学习模型,在各种语言和视觉任务中展现了惊人的性能,这些任务传统上使用较小规模的模型难以实现。GPT 类语言模型的重大成功尤为激动人心,为基础模型在其他领域(包括卫星遥感)的潜力敛起了期望。在此背景下,已致力于构建基础模型以测试其在更广泛应用中的能力,诸如 NASA-IBM 开发的 Prithvi、Segment-Anything-Model、ViT 等。于是出现了一个重要问题:基础模型是否总是适用于不同遥感任务,何时或何时不适用?本工作旨在通过对比传统机器学习(ML)和常规规模深度学习模型,增进对基础模型在中等分辨率多光谱影像像素级分类任务中状态及适用性的理解。有趣的是,结果揭示,在许多情境下,传统 ML 模型仍与基础模型相当或表现更好,尤其是在纹理对分类贡献较小的任务上。另一方面,深度学习模型在标签部分依赖于纹理(如灼伤痕迹)的任务上表现更具前景,而基础模型与深度学习模型之间的性能差异并不明显。结果符合我们的分析:基础模型的适用性取决于自监督学习任务与实际下游任务之间的对齐程度,典型的掩码自编码器范式并不一定适用于许多遥感问题。

关键词

引用

@article{arxiv.2404.11797,
  title  = {When are Foundation Models Effective? Understanding the Suitability for Pixel-Level Classification Using Multispectral Imagery},
  author = {Yiqun Xie and Zhihao Wang and Weiye Chen and Zhili Li and Xiaowei Jia and Yanhua Li and Ruichen Wang and Kangyang Chai and Ruohan Li and Sergii Skakun},
  journal= {arXiv preprint arXiv:2404.11797},
  year   = {2024}
}