中文

上下文局部视觉嵌入的自监督学习

计算机视觉与模式识别 2023-10-05 v3

摘要

我们提出上下文局部视觉嵌入(CLoVE),一种基于卷积的自监督方法,可学习适用于密集预测任务的表征。CLoVE 偏离现有方法,优化单一损失函数,该损失函数在从卷积神经网络(CNN)编码器的输出特征图学习到的上下文局部嵌入层面上运作。为学习上下文嵌入,CLoVE 提出一种归一化多头自注意力层,基于相似性组合图像不同局部的局部特征。我们在多个数据集上广泛基准测试了 CLoVE 的预训练表征。CLoVE 在包括目标检测、实例分割、关键点检测和密集姿态估计在内的 4 项密集预测下游任务中达到了基于 CNN 架构的 SOTA 性能。

关键词

引用

@article{arxiv.2310.00527,
  title  = {Self-supervised Learning of Contextualized Local Visual Embeddings},
  author = {Thalles Santos Silva and Helio Pedrini and Adín Ramírez Rivera},
  journal= {arXiv preprint arXiv:2310.00527},
  year   = {2023}
}

备注

Pre-print. 4th Visual Inductive Priors for Data-Efficient Deep Learning Workshop ICCV 2023. Code at https://github.com/sthalles/CLoVE