TOV:面向光学遥感图像理解的自监督原始视觉模型
计算机视觉与模式识别
2022-04-12 v1 人工智能
计算机科学与博弈论
摘要
我们是否正通过依赖监督数据、依赖任务的方式训练模型来进行遥感图像理解(RSIU),而非像人类视觉那样以无标签、任务无关的方式进行,从而走在正确的道路上?我们认为,更理想的RSIU模型应当从数据的内在结构中学习,而非从外在的人类标签中学习,以实现在广泛RSIU任务上的泛化能力。基于这一假设,我们提出了遥感领域的原始视觉模型(The Original Vision model, TOV)。TOV模型通过海量无标签光学数据,沿从通用知识到专用知识的人类般自监督学习(SSL)路径进行训练,可轻松适配各类RSIU任务,包括场景分类、目标检测和语义分割,并在12个公开基准中的大多数上优于主导的ImageNet监督预训练方法以及两种近期提出的SSL预训练方法。此外,我们分析了构建RSIU的TOV模型时两个关键因素对性能的影响,包括使用不同数据采样方法的影响以及自监督优化过程中学习路径的选择。我们相信,以无标签、任务无关方式训练的通用模型可能成为RSIU的下一个范式,并希望从本研究中提炼的见解有助于推动RSIU原始视觉模型的发展。
引用
@article{arxiv.2204.04716,
title = {TOV: The Original Vision Model for Optical Remote Sensing Image Understanding via Self-supervised Learning},
author = {Chao Tao and Ji Qia and Guo Zhang and Qing Zhu and Weipeng Lu and Haifeng Li},
journal= {arXiv preprint arXiv:2204.04716},
year = {2022}
}
备注
38 pages, 5 figures, 8 Tables