中文

S-JEA:用于自监督视觉表示学习的堆叠联合嵌入架构

计算机视觉与模式识别 2024-11-06 v2 机器学习

摘要

自监督学习(SSL)作为学习图像表示的基本范式近期兴起,并已在多种任务中展现出高度的实证成功。然而,大多数 SSL 方法未能学习到可分离且可解释的、捕捉层次语义概念的嵌入。在本工作中,我们旨在通过堆叠联合嵌入架构(JEA)来学习高度可分离的语义层次表示,其中较高级 JEA 以较低级 JEA 的表示为输入。这产生了在较高级 JEA 中展现语义概念(如车辆的型号与颜色)明显子类别的表示空间。我们通过实证表明,堆叠 JEA 的表示与传统 JEA 在参数量相当时性能相近,并对表示空间进行可视化以验证语义层次。

关键词

引用

@article{arxiv.2305.11701,
  title  = {S-JEA: Stacked Joint Embedding Architectures for Self-Supervised Visual Representation Learning},
  author = {Alžběta Manová and Aiden Durrant and Georgios Leontidis},
  journal= {arXiv preprint arXiv:2305.11701},
  year   = {2024}
}

备注

9 pages, 4 figures, 3 tables; V2: fixed typos