DMT-JEPA: 用于联合嵌入预测架构的判别性掩码目标
计算机视觉与模式识别
2024-05-29 v1 人工智能
机器学习
图像与视频处理
摘要
联合嵌入预测架构(JEPA)最近在掩码策略下从无标签图像中提取视觉表示方面展示了令人印象深刻的结果。然而,我们揭示了其缺点,特别是其对局部语义的理解不足。这种缺陷源于嵌入空间中的掩码建模,导致判别能力降低,甚至可能忽略关键的局部语义。为了弥补这一差距,我们引入了DMT-JEPA,这是一种根植于JEPA的新型掩码建模目标,专门设计用于从邻近信息生成判别性潜在目标。我们的核心思想很简单:我们将一组语义相似的邻近补丁视为掩码补丁的目标。具体来说,所提出的DMT-JEPA (a) 计算每个掩码补丁与其对应邻近补丁之间的特征相似性,以选择具有语义相关关系的补丁,以及(b) 采用轻量级交叉注意力头来聚合邻近补丁的特征作为掩码目标。因此,DMT-JEPA表现出强大的判别能力,为各种下游任务提供了益处。通过大量实验,我们在各种视觉基准上证明了我们的有效性,包括ImageNet-1K图像分类、ADE20K语义分割和COCO目标检测任务。代码可在以下网址获取:\url{https://github.com/DMTJEPA/DMTJEPA}。
引用
@article{arxiv.2405.17995,
title = {DMT-JEPA: Discriminative Masked Targets for Joint-Embedding Predictive Architecture},
author = {Shentong Mo and Sukmin Yun},
journal= {arXiv preprint arXiv:2405.17995},
year = {2024}
}