中文

基于无标签数据集的主动少样本顶点分类

机器学习 2025-04-29 v1

摘要

尽管图数据充足可用,但获取顶点标签是繁琐且昂贵的任务。因此,有必要仅从少量标记顶点中学习。现有的少样本学习方法假设存在类别秀(class oracle),该秀为所需类别提供标记顶点。然而,在现实场景中,当为顶点打标签时,尚不知道该顶点属于哪个类别,这种秀是不可用的。少样本学习方法通常与原型网络结合使用,而经典的半监督顶点分类则使用判别模型(如图卷积网络(GCN))。在本文中,我们通过迭代地向人类标注员提出顶点进行标注来训练模型。我们进行了三个实验,其中不断放宽我们的假设。首先,我们假设存在类别秀,即人类标注员被提供有相同数量的顶点可为每个类别打标签。我们将此称为“平衡抽样”。在随后的实验中,“不平衡抽样”,我们用 kk 中心聚类取代类别秀,从聚类中抽取待标注的顶点。在最后一个实验中,“未知类别数”,我们不再假设知道类别的数量和分布。我们的结果表明,在每个类别可用少于20个样本时,原型模型在所有实验中均优于判别模型。当放弃“不平衡抽样”实验中类别秀的假设时,GCN的性能下降了9%,而原型网络仅下降了平均1%。对于“未知类别数”实验,两个模型的平均性能进一步下降了1%。源代码:https://github.com/Ximsa/2023-felix-ma

关键词

引用

@article{arxiv.2504.18696,
  title  = {Active Few-Shot Learning for Vertex Classification Starting from an Unlabeled Dataset},
  author = {Felix Burr and Marcel Hoffmann and Ansgar Scherp},
  journal= {arXiv preprint arXiv:2504.18696},
  year   = {2025}
}

备注

Accepted at IJCNN 2025