HIRL:一种层次化图像表示学习的通用框架
计算机视觉与模式识别
2022-05-27 v1
摘要
学习自监督图像表示已被广泛研究以推动各类视觉理解任务。现有方法通常学习单一层级的图像语义,如成对语义相似性或图像聚类模式。然而,这些方法难以捕捉图像数据集中自然存在的多层级语义信息,例如物种图像库中编码的“波斯猫到猫到哺乳动物”的语义层次。因此,任意图像自监督学习(SSL)方法能否从学习此类层次语义中获益尚属未知。为回答该问题,我们提出一种用于层次化图像表示学习(HIRL)的通用框架。该框架旨在为每幅图像学习多个语义表示,且这些表示被结构化以从细粒度到粗粒度编码图像语义。基于概率分解,HIRL 通过现成的图像 SSL 方法学习最细粒度语义,并通过一种新颖的语义路径判别方案学习多个粗粒度语义。我们采用六种代表性图像 SSL 方法作为基线,并研究它们在 HIRL 下的表现。通过严格的公平比较,观察到全部六种方法在多样化下游任务上均获得性能提升,这首次验证了学习层次化图像语义的通用有效性。所有源代码与模型权重发布于 https://github.com/hirl-team/HIRL
引用
@article{arxiv.2205.13159,
title = {HIRL: A General Framework for Hierarchical Image Representation Learning},
author = {Minghao Xu and Yuanfan Guo and Xuanyu Zhu and Jiawen Li and Zhenbang Sun and Jian Tang and Yi Xu and Bingbing Ni},
journal= {arXiv preprint arXiv:2205.13159},
year = {2022}
}
备注
Research project paper. arXiv v1: all source code and model weights released