分析图对比学习中的数据中心性质
机器学习
2023-01-24 v3
摘要
近期对自监督学习(SSL)的分析发现以下数据中心性质对学习良好表示至关重要:对任务无关语义的不变性、在某些潜空间中类别的可分离性,以及从增强样本恢复标签的可恢复性。然而,鉴于图数据集和图SSL方法的离散、非欧几里得特性,它们不太可能满足这些性质。这引发了一个问题:诸如对比学习(CL)之类的图SSL方法为何能良好工作?为系统性探究该问题,我们对使用通用图增强(GGAs)的CL进行了泛化分析,重点关注数据中心性质。我们的分析对GGAs的局限性和任务相关增强的必要性给出了形式化见解。正如我们经验所示,在常用基准数据集上GGAs并不诱导任务相关的不变性,导致相对于朴素的未训练基线仅有边际增益。我们的理论催生了一种合成数据生成过程,可控制任务相关信息并具备预定义的最优增强。该灵活基准帮助我们识别了先进增强技术(如自动化方法)中尚未被认识到的局限性。总体而言,我们的工作从经验和理论两方面严格地将数据中心性质对图SSL增强策略和学习范式的影响置于具体语境中。
引用
@article{arxiv.2208.02810,
title = {Analyzing Data-Centric Properties for Graph Contrastive Learning},
author = {Puja Trivedi and Ekdeep Singh Lubana and Mark Heimann and Danai Koutra and Jayaraman J. Thiagarajan},
journal= {arXiv preprint arXiv:2208.02810},
year = {2023}
}
备注
Accepted to NeurIPS 2022