中文

GLID:预训练通用编码器-解码器视觉模型

计算机视觉与模式识别 2024-04-12 v1

摘要

本文提出了一种通用编码器-解码器预训练方法,用于更好地处理各种下游计算机视觉任务。虽然自监督预训练方法(例如掩码自编码器)在迁移学习中取得了成功,但针对不同的下游任务仍然需要附加特定于任务的子架构,这无法享受大规模预训练的好处。GLID通过允许预训练的通用编码器-解码器以最小的特定任务架构修改在各种视觉任务上进行微调来克服这一挑战。在GLID训练方案中,预训练借口任务和其他下游任务被建模为“查询到答案”问题。我们使用查询-掩码对预训练一个任务无关的编码器-解码器。在微调期间,GLID保持预训练的编码器-解码器和查询不变,仅将最顶层的线性变换层替换为特定于任务的线性头。这最小化了预训练-微调架构的不一致性,并使预训练模型能够更好地适应下游任务。GLID在各种视觉任务上取得了有竞争力的性能,包括目标检测、图像分割、姿态估计和深度估计,优于或匹配Mask2Former、DETR、ViTPose和BinsFormer等专业模型。

关键词

引用

@article{arxiv.2404.07603,
  title  = {GLID: Pre-training a Generalist Encoder-Decoder Vision Model},
  author = {Jihao Liu and Jinliang Zheng and Yu Liu and Hongsheng Li},
  journal= {arXiv preprint arXiv:2404.07603},
  year   = {2024}
}

备注

CVPR 2024