面向超越物体的视觉表示的双曲对比学习
计算机视觉与模式识别
2022-12-02 v1 机器学习
摘要
尽管自监督/无监督方法已在视觉表示学习中取得快速进展,这些方法通常将物体与场景同等对待。在本文中,我们专注于学习保留物体与场景之间结构的物体与场景表示。受视觉相似物体在表示空间中相近这一观察的启发,我们认为场景与物体应依据其组合性遵循层次化结构。为利用此种结构,我们提出了一种对比学习框架,其中使用欧几里得损失学习物体表示,并使用双曲损失鼓励场景的表示在双曲空间中靠近其组成物体的表示。这一新颖的双曲目标通过优化其范数大小来鼓励表示间的场景-物体上位关系。我们表明,在COCO和OpenImages数据集上预训练时,双曲损失在多个数据集与任务(包括图像分类、目标检测和语义分割)上提升了若干基线的下游性能。我们还表明,所学表示的特性使我们能够以零样本方式解决涉及场景与物体交互的各种视觉任务。我们的代码可在 \url{https://github.com/shlokk/HCL/tree/main/HCL} 找到。
引用
@article{arxiv.2212.00653,
title = {Hyperbolic Contrastive Learning for Visual Representations beyond Objects},
author = {Songwei Ge and Shlok Mishra and Simon Kornblith and Chun-Liang Li and David Jacobs},
journal= {arXiv preprint arXiv:2212.00653},
year = {2022}
}