中文

面向低资源下游任务的自监督掩码数字高程模型编码

计算机视觉与模式识别 2023-09-08 v1 人工智能

摘要

缺乏高质量的标注数据是训练深度学习模型的主要瓶颈之一。随着任务复杂度的提升,过拟合与不稳定学习带来的代价更高。当今采用的典型范式是自监督学习,模型试图从大量非结构化且无标注的数据中学习,再将知识迁移至所需任务。其他模态中自监督的一些显著例子包括用于大语言模型(Large Language Model, LLM)的 BERT、用于语音识别的 Wav2Vec,以及用于视觉的掩码自编码器(Masked AutoEncoder),它们都利用 Transformer 来解决掩码预测任务。GeoAI 因数十年来所收集的数据中极少被精确且可靠地标注,而独具优势以利用自监督方法。我们的目标是从数字高程模型(Digital Elevation Models, DEM)中提取建筑与道路分割,DEM 提供了地球表面的详细地形。所提架构为在 ImageNet 上预训练的掩码自编码器(因 ImageNet 与 DEM 间存在较大域差异这一限制),并带有用于解码分割的 UperNet Head。我们仅用 450 张和 50 张训练图像测试了该模型,分别约使用了原始数据的 5% 和 0.5%。在建筑分割任务上,该模型用 450 张图像取得 82.1% 的交并比(Intersection over Union, IoU),仅用 50 张图像取得 69.1% 的 IoU。在更具挑战性的道路检测任务上,模型用 450 张图像取得 82.7% 的 IoU,仅用 50 张图像取得 73.2% 的 IoU。当今任何关于地球表面的手工标注数据集都会因地表持续变化的性质而立刻过时。这凸显了对于可用于广泛下游任务的数据高效学习器的明确需求。

关键词

引用

@article{arxiv.2309.03367,
  title  = {Self-Supervised Masked Digital Elevation Models Encoding for Low-Resource Downstream Tasks},
  author = {Priyam Mazumdar and Aiman Soliman and Volodymyr Kindratenko and Luigi Marini and Kenton McHenry},
  journal= {arXiv preprint arXiv:2309.03367},
  year   = {2023}
}