图对比学习中基于亲和度不确定性的难负样本挖掘
机器学习
2024-01-09 v2 社会与信息网络
摘要
难负样本挖掘已证明可有效增强包括图对比学习(GCL)在内的多种数据类型上的自监督对比学习(CL)。现有的硬度感知 CL 方法通常将与锚样本最相似的负样本视为难负样本,这有助于提高 CL 性能,尤其是在图像数据上。然而,这种方法在图数据上往往无法识别难负样本,反而导致许多假负样本。这主要是由于图数据中过平滑表示和/或非独立同分布(non-i.i.d.)问题导致学到的图表示不够有判别力。为解决这个问题,本文提出一种新方法,在集体亲和度信息(即负样本与锚样本之间的两组成对亲和度)上构建判别模型,以在 GCL 中挖掘难负样本。具体而言,所提方法评估判别模型对每个负样本相对于锚样本的亲和度的置信/不确定程度,以确定其相对于锚样本的硬度权重。该不确定性信息随后通过加权项融入现有 GCL 损失函数以增强其性能。增强的 GCL 在理论上有依据:所得 GCL 损失等价于一个三元组损失,其自适应边界与每个负样本学到的不确定性呈指数比例。在十个图数据集上的大量实验表明我们的方法:1)在图和节点分类任务中一致地增强不同的最先进(SOTA)GCL 方法;2)显著提升它们对抗对抗攻击的鲁棒性。代码见 https://github.com/mala-lab/AUGCL。
引用
@article{arxiv.2301.13340,
title = {Affinity Uncertainty-based Hard Negative Mining in Graph Contrastive Learning},
author = {Chaoxi Niu and Guansong Pang and Ling Chen},
journal= {arXiv preprint arXiv:2301.13340},
year = {2024}
}
备注
Accepted to TNNLS