通过将词语嵌入表示空间来构建共享研究兴趣的网络
社会与信息网络
2025-02-12 v1
摘要
大学内的部门不仅是行政单位,还是将研究者围绕共同学术领域聚集的努力。一个普遍的挑战是连接拥有共同研究兴趣的成员,无论是在同一部门内还是跨部门之间。本文描述了一种工作流程,通过自然语言处理的方法为生成连接大学部门成员()或多个部门()的网络,基于其研究出版物中的共同主题。在从 PubMed 数据库中提取并处理 篇摘要的文本后,术语的共现被编码为稀疏文档-术语矩阵。基于每个术语对之间的位置距离,我使用统一流形近似和投影(UMAP)方法将术语嵌入表示空间,使得倾向于出现在相同文档中的术语彼此更接近。每个作者的语料库在该空间中定义了对术语的概率分布。使用 Wasserstein 距离量化这些分布之间的相似性,我生成了作者之间的距离矩阵,可作为图形进行分析和可视化。我演示了这种无参数方法产生的聚类具有与某些学术划分相符的 distinct 主题,同时识别了成员之间未被利用的连接。该工作流程的 Python 和 R 脚本已在 MIT 许可下提供,地址为 https://github.com/PoonLab/tragula。
引用
@article{arxiv.2502.07042,
title = {Building networks of shared research interests by embedding words into a representation space},
author = {Art Poon},
journal= {arXiv preprint arXiv:2502.07042},
year = {2025}
}