图结构与标签依赖如何贡献于大规模文档网络中的节点分类
机器学习
2024-02-12 v2 统计理论
统计理论
摘要
我们引入了一个名为 WikiVitals 的新数据集,其中包含一张由 48k 篇相互引用的维基百科文章组成的大图,这些文章被分为 32 个类别,并由 2.3M 条边连接。我们的目标是在半监督节点分类设定下,严格评估三种不同信息来源对标签预测的贡献,即文章的内容、文章之间的连接以及它们标签之间的相关性。我们使用图马尔可夫神经网络(Graph Markov Neural Network)进行该评估,该网络为这一任务提供了理论上严谨的模型,并且我们通过明确区分模型选择与模型评估,对每种信息来源的贡献进行了详细评估。一个有趣的观察是,与稠密训练集相比,纳入标签依赖的影响对于稀疏训练集更为相关。
引用
@article{arxiv.2304.01235,
title = {How Graph Structure and Label Dependencies Contribute to Node Classification in a Large Network of Documents},
author = {Pirmin Lemberger and Antoine Saillenfest},
journal= {arXiv preprint arXiv:2304.01235},
year = {2024}
}
备注
10 pages, 1 figure