中文

面向多数据类型文本分析的多层网络

社会与信息网络 2021-07-01 v1 物理与社会 机器学习

摘要

我们关注一个普遍存在的问题:在存在元数据和超链接的情况下,对大规模文本文档集合进行文档聚类和主题发现。为应对整合这些不同类型数据集的挑战,我们提出了一种基于多层网络与随机块模型的新框架。相较于其他技术,我们方法的主要创新在于将同一非参数概率框架同时应用于不同来源的数据集。与其他多层复杂网络的关键区别在于各层之间强烈的非平衡性,不同节点类型的平均度随系统规模呈不同方式的缩放。我们表明,后一现象源于文本的通用性质(如希普斯定律),并强烈影响社群的推断。我们在不同数据集(数百篇维基百科文档、数千篇科学论文以及数千封电子邮件)上展示并讨论了方法的性能,表明考虑多种类型的信息能为主题与文档聚类提供更细致的视角,并提升预测缺失链接的能力。

关键词

引用

@article{arxiv.2106.15821,
  title  = {Multilayer Networks for Text Analysis with Multiple Data Types},
  author = {Charles C. Hyland and Yuanming Tao and Lamiae Azizi and Martin Gerlach and Tiago P. Peixoto and Eduardo G. Altmann},
  journal= {arXiv preprint arXiv:2106.15821},
  year   = {2021}
}

备注

17 pages, 6 figures