重新思考图上的半监督学习设定
机器学习
2022-05-31 v1
摘要
我们认为当前图上的半监督学习设定可能导致不公平比较,因其存在利用验证集标签信息调优超参数以使模型过拟合的潜在风险。本文强调了调优超参数的显著影响,其利用验证集中的标签信息来提升性能。为探索超参数过调优的极限,我们提出ValidUtil,一种通过额外一组超参数充分利用验证集标签信息的方法。借助ValidUtil,即便GCN也能在Cora上轻松取得85.8%的高准确率。为避免过调优,我们将训练集与验证集合并,构建了由4个数据集组成的独立同分布图基准(IGB)。每个数据集包含从大图中采样的100个独立同分布图,以降低评估方差。我们的实验表明,相较于先前的数据集,IGB是图上半监督学习更稳定的基准。
引用
@article{arxiv.2205.14403,
title = {Rethinking the Setting of Semi-supervised Learning on Graphs},
author = {Ziang Li and Ming Ding and Weikai Li and Zihan Wang and Ziyu Zeng and Yukuo Cen and Jie Tang},
journal= {arXiv preprint arXiv:2205.14403},
year = {2022}
}
备注
To appear in IJCAI 2022