LLMs 能否预测学术合作?拓扑启发式方法与基于 LLM 的链接预测在真实合著网络上的对比
社会与信息网络
2026-04-03 v1 人工智能
摘要
大语言模型(LLMs)能否预测哪些研究人员将进行合作?通过在世界真实合著网络(OpenAlex,996 万作者,1.087 亿条边)上进行链接预测研究,我们评估了 LLMs 是否仅利用作者画像(无需访问图结构)即可预测未来的科学合作。使用 Qwen2.5-72B-Instruct 跨越 AI 研究的三个历史时期,我们发现 LLMs 与拓扑启发式方法捕捉到了不同的信号,在互补设置中最强。在自然类别不平衡下的新边预测中,LLM 达到 AUROC 0.714–0.789,优于 Common Neighbors、Jaccard 和 Preferential Attachment,召回率高达 92.9%;在平衡评估中,LLM 在每个时期均优于所有拓扑启发式方法(AUROC 0.601–0.658 对比最佳启发式方法 0.525–0.538);在持续边上,LLM(0.687)与 Adamic-Adar(0.684)具有竞争力。关键的是,78.6–82.7% 的新合作发生在没有共同邻居的作者之间——这是所有拓扑启发式方法得分均为零的盲区,而 LLM 仅通过作者元数据推理仍能达到 AUROC 0.652。时间元数据消融实验表明研究概念是主导信号(移除概念使 AUROC 下降 0.047–0.084)。向 LLM 提供预计算的图特征会因锚定效应而降低性能,确认 LLMs 与拓扑方法应作为独立、互补的通道运作。社会文化消融实验发现,推断的族裔和机构国家无法在拓扑之外预测合作,反映了 AI 研究的人口同质性。node2vec 基线达到与 Adamic-Adar 相当的 AUROC,表明 LLM 访问的是根本不同的信息通道——作者元数据——而非以不同方式编码相同的结构信号。
引用
@article{arxiv.2604.01379,
title = {Can LLMs Predict Academic Collaboration? Topology Heuristics vs. LLM-Based Link Prediction on Real Co-authorship Networks},
author = {Fan Huang and Munjung Kim},
journal= {arXiv preprint arXiv:2604.01379},
year = {2026}
}