S-JEA:用于自监督视觉表示学习的堆叠联合嵌入架构
计算机视觉与模式识别
2024-11-06 v2 机器学习
摘要
自监督学习(SSL)作为学习图像表示的基本范式近期兴起,并已在多种任务中展现出高度的实证成功。然而,大多数 SSL 方法未能学习到可分离且可解释的、捕捉层次语义概念的嵌入。在本工作中,我们旨在通过堆叠联合嵌入架构(JEA)来学习高度可分离的语义层次表示,其中较高级 JEA 以较低级 JEA 的表示为输入。这产生了在较高级 JEA 中展现语义概念(如车辆的型号与颜色)明显子类别的表示空间。我们通过实证表明,堆叠 JEA 的表示与传统 JEA 在参数量相当时性能相近,并对表示空间进行可视化以验证语义层次。
引用
@article{arxiv.2305.11701,
title = {S-JEA: Stacked Joint Embedding Architectures for Self-Supervised Visual Representation Learning},
author = {Alžběta Manová and Aiden Durrant and Georgios Leontidis},
journal= {arXiv preprint arXiv:2305.11701},
year = {2024}
}
备注
9 pages, 4 figures, 3 tables; V2: fixed typos