中文

为高效改变检测适配视觉转换器

计算机视觉与模式识别 2023-12-11 v1

摘要

目前大多数基于视觉转换器的改变检测模型遵循“预训练后微调”策略,这涉及使用来自大规模分类数据集(可能是自然图像或遥感图像)初始化模型权重。然而,完全微调此类模型需要大量时间和资源。本文提出一种高效微调方法,包括冻结预训练图像编码器的参数并引入额外的训练参数。通过该方法,我们在六个改变检测基准数据集上实现了具竞争力甚至更好结果,同时保持极低的资源消耗。例如,在LEVIR-CD(一个改变检测基准数据集)上的训练时间仅需半小时,内存使用为9 GB,对于大多数研究人员来说非常便利。此外,解耦的微调框架可扩展到任何预训练模型,用于语义改变检测和多时序改变检测。我们希望我们的新方法能作为基础模型的组成部分,激发更多在改变检测领域的统一训练方法。

关键词

引用

@article{arxiv.2312.04869,
  title  = {Adapting Vision Transformer for Efficient Change Detection},
  author = {Yang Zhao and Yuxiang Zhang and Yanni Dong and Bo Du},
  journal= {arXiv preprint arXiv:2312.04869},
  year   = {2023}
}