网络上的选择性采集
社会与信息网络
2017-03-16 v1 机器学习
机器学习
摘要
图上的主动搜索(AS)关注在给定查询预算下,利用网络拓扑及其边权的全局知识来收集特定标记节点(目标)。然而,在大多数网络中,节点、拓扑和边权最初都是未知的。我们引入了选择性采集,这是 AS 的一种变体,其中下一个要查询的节点必须在当前已查询节点集的邻居中选择;用于决定查询哪个节点的可用训练数据被限制在由已查询集(及其节点属性)及其邻居(无任何节点或边属性)诱导的子图中。因此,选择性采集是一个序贯决策问题,我们必须在每一步决定查询哪个节点。在此场景下训练的分类器会受到隧道视觉效应的影响:在没有独立采样的情况下,查询有前景节点的驱动力迫使分类器收集越来越有偏差的训练数据,我们表明这会显著损害 AS 方法和标准分类器的性能。我们发现,通过使用多个分类器可以收集到更大规模的目标集,这并非通过将它们的预测组合为集成,而是在每一步切换所使用的分类器,以此作为缓解隧道视觉效应的一种方式。我们发现,切换分类器能收集更多目标,其方式是 通过使训练数据多样化,以及 扩大下一步可查询节点的选择范围。这凸显了我们问题中探索、利用和多样化之间的权衡,这超越了经典序贯决策问题中的探索与利用二元对立。基于这些观察,我们提出了 D3TS,这是一种基于面向非平稳随机过程的多臂赌博机的方法,它强制分类器多样性,在我们的评估中,它在七个真实网络数据集上匹配或超越了竞争方法的性能。
引用
@article{arxiv.1703.05082,
title = {Selective Harvesting over Networks},
author = {Fabricio Murai and Diogo Rennó and Bruno Ribeiro and Gisele L. Pappa and Don Towsley and Krista Gile},
journal= {arXiv preprint arXiv:1703.05082},
year = {2017}
}
备注
28 pages, 9 figures