中文

SG-MIM:引导结构化知识的高效密集预测预训练方法

计算机视觉与模式识别 2024-09-05 v1

摘要

掩码图像建模(MIM)技术正在重新定义计算机视觉的研究格局,使预训练模型在广泛的任务范围内实现卓越的性能。尽管已取得成功,但MIM方法在密集预测任务(特别是深度估计)中的潜力仍未被充分发掘。现有MIM方法主要依赖单张图像输入,难以捕获关键结构化信息,导致在需要精细特征表示的任务上表现次优。为解决这些限制,我们提出了SG-MIM——一种 novel 的结构化知识引导掩码图像建模框架,用于增强密集预测任务的性能。SG-MIM采用轻量级关系引导框架,使其能够在特征层级上而非在像素层级上对结构化知识进行个性化引导,这与传统多模态预训练方法的常规做法不同。这种方法使模型能够高效地捕获关键信息,同时最大限地减少预训练与下游任务之间的差异。此外,SG-MIM采用选择性掩码策略来整合结构化知识,以最大化通用表征学习与结构化知识特定学习之间的协同作用。该方法无需额外标注,因而是一种通用且高效的解决方案,可适用于广泛的应用场景。我们在KITTI、NYU-v2和ADE20k数据集上的评估表明,SG-MIM在单目深度估计和语义分割任务中表现优异。

关键词

引用

@article{arxiv.2409.02513,
  title  = {SG-MIM: Structured Knowledge Guided Efficient Pre-training for Dense Prediction},
  author = {Sumin Son and Hyesong Choi and Dongbo Min},
  journal= {arXiv preprint arXiv:2409.02513},
  year   = {2024}
}