用于带文本边网络聚类与表示的深度隐位置主题模型
机器学习
2024-02-14 v3 计算与语言
社会与信息网络
统计方法学
摘要
用户分享他人发布的文本内容这一数值化交互行为,自然可表示为一个网络:个体关联节点,交换的文本关联边。为理解这些异构且复杂的数据结构,必须将节点聚类为同质组,并对数据给出可理解的视觉呈现。针对这两个问题,我们提出 Deep-LPTM,一种基于模型的聚类策略,它依赖变分图自编码器方法以及刻画讨论主题的概率模型。Deep-LPTM 可在两个嵌入空间中构建节点与边的联合表示。参数通过变分推断算法进行推断。我们还提出 IC2L,一种专门设计的模型选择准则,用于挑选具备相关聚类与可视化性质的模型。我们给出了在合成数据上的广泛基准研究。特别地,我们发现 Deep-LPTM 比当前最优的 ETSBM 和 STBM 更好地恢复了节点划分。最后,我们分析了 Enron 公司的电子邮件,并展示了结果的可视化,对图结构给出了有意义的凸显。
引用
@article{arxiv.2304.08242,
title = {The Deep Latent Position Topic Model for Clustering and Representation of Networks with Textual Edges},
author = {Rémi Boutin and Pierre Latouche and Charles Bouveyron},
journal= {arXiv preprint arXiv:2304.08242},
year = {2024}
}
备注
29 pages including the appendix, 13 figures, 6 tables, journal paper