中文

从过拟合到鲁棒性:基于数量、质量和多样性的图对比学习中的负样本选择

机器学习 2025-03-05 v1 人工智能

摘要

图对比学习 (GCL) 旨在对比正负样本对应项,以学习节点嵌入,而图数据增强方法则用于生成这些正负样本。负样本相对于正样本的变体、数量和质量,对学习节点分类下游任务中有意义的嵌入至关重要。负样本的变体不足、数量过多和质量不足会导致模型对特定节点过拟合,从而产生不够稳健的模型。为解决 GCL 范式中的过拟合问题,本研究提出了一种新的累积样本选择 (Cumulative Sample Selection, CSS) 算法,综合考虑负样本的质量、变体和数量。首先构建三个负样本池:易负样本、中等负样本和难负样本,分别包含全部可用负样本的 25%、50% 和 25%。随后从这三个负样本池中各选取 10% 的负样本用于模型训练。随后,一个决策代理模块评估模型训练结果,并决定是否探索更多来自三个负样本池的样本(通过增加比例)或继续利用当前的采样比例。该算法集成到一个名为 NegAmplify 的图对比学习框架中。NegAmplify 在九个图节点分类数据集上与 SOTA 方法进行比较,其中七个数据集实现了更好的节点分类准确率,提升幅度最高可达 2.86%。

关键词

引用

@article{arxiv.2406.15044,
  title  = {From Overfitting to Robustness: Quantity, Quality, and Variety Oriented Negative Sample Selection in Graph Contrastive Learning},
  author = {Adnan Ali and Jinlong Li and Huanhuan Chen and Ali Kashif Bashir},
  journal= {arXiv preprint arXiv:2406.15044},
  year   = {2025}
}