SaPHyRa:一种用于大型网络节点排序的学习理论方法
社会与信息网络
2022-03-04 v1
摘要
基于中心性对节点进行排序是大规模网络中一个基本但具有挑战性的问题。近似方法可以快速估计节点的中心性并识别最中心的节点,但对大多数剩余节点的排序可能毫无意义。例如,搜索查询中不知名网站的排序已知是嘈杂且不稳定的。为此,我们研究了一个新的节点排序问题,具有两个重要区别:a) 以排序质量而非中心性估计质量作为主要目标;b) 仅对感兴趣的节点排序,例如匹配搜索条件的网站。我们提出了样本空间划分假设排序(Sample space Partitioning Hypothesis Ranking,SaPHyRa),将节点排序转化为机器学习中的假设排序。该转换将节点的中心性映射到假设的期望风险,为理论机器学习(ML)工具打开了大门。SaPHyRa 的关键是将样本空间划分为精确子空间和近似子空间。精确子空间包含与感兴趣节点相关的样本,提高了估计和排序质量。近似空间可利用基于 ML 的技术高效采样,从而为估计误差提供理论保证。最后,我们提出 SaPHyRa_bc,作为 SaPHyRa 在节点介数中心性(BC)排序上的示例。通过结合新颖的双连通分量采样、2-hop 样本划分以及改进的 Vapnik-Chervonenkis 维界,SaPHyRa_bc 可有效对任意节点子集按 BC 排序。其在近似 BC 时比最先进(SOTA)方法快至多 200 倍,且与真实值的排序相关性提高了数倍。
引用
@article{arxiv.2203.01746,
title = {SaPHyRa: A Learning Theory Approach to Ranking Nodes in Large Networks},
author = {Phuc Thai and My T. Thai and Tam Vu and Thang N. Dinh},
journal= {arXiv preprint arXiv:2203.01746},
year = {2022}
}
备注
To appear in IEEE ICDE'22