中文

社区发现中的隐式模型、潜在压缩、内在偏置与廉价午餐

社会与信息网络 2023-11-09 v7 机器学习 数据分析、统计与概率 物理与社会 机器学习

摘要

社区发现旨在将网络划分为节点簇以总结其大规模结构,该任务催生了许多具有不同目标的竞争算法。一些社区发现方法是推断性的,通过概率生成模型显式推导聚类目标,而其他方法是描述性的,根据特定应用动机的目标划分网络,这使得在同一尺度上比较这些方法具有挑战性。在此我们提出该问题的一种解决方案,将任意社区发现目标(推断性或描述性)与其对应的隐式网络生成模型相关联。这使我们能够计算任意目标下网络及其划分的描述长度,提供一种无需“真实”标签即可比较不同算法性能的原则性度量。我们的方法还能给出对任意给定算法最优的社区发现问题实例,并由此揭示流行描述性方法中的内在偏置,解释其过拟合倾向。利用我们的框架,我们在人工网络及超过 500 个结构多样的实证网络语料上比较了若干社区发现方法。我们发现更具表达力的社区发现方法在结构化数据实例上展现出持续优越的压缩性能,而在少数更专门算法最优的情形中性能并未退化。我们的结果在概念与实践上均削弱了社区发现的“无免费午餐”定理的隐含意义,因为该定理局限于非结构化数据实例,而有意义的社区发现问题按定义是结构化的。

关键词

引用

@article{arxiv.2210.09186,
  title  = {Implicit models, latent compression, intrinsic biases, and cheap lunches in community detection},
  author = {Tiago P. Peixoto and Alec Kirkley},
  journal= {arXiv preprint arXiv:2210.09186},
  year   = {2023}
}

备注

28 pages, 18 figures