基于大语言模型的文本丰富图层次压缩
社会与信息网络
2024-06-19 v1 人工智能
摘要
文本丰富图在数据挖掘领域广泛存在,如电子商务图和学术图谱,由带有文本特征的节点及由各种关系连接的节点组成。传统图机器学习模型,如图神经网络(GNN),在编码图结构信息方面表现优异,但在处理图节点上的丰富文本方面能力有限。大语言模型(LLM)凭借其优越的文本理解能力,为处理图中的文本提供了解决方案,但由于其在编码图结构和处理大规模节点邻居文本时计算复杂度的限制,面临集成挑战。本文引入“层次压缩”(HiCom)方法,以拟合大语言模型能力与文本丰富图结构之间的匹配。HiCom以结构化方式处理节点邻居中的文本,组织大量文本信息为更易管理的层次结构,并逐步压缩节点文本。因此,HiCom不仅保留文本的语境丰富性,还解决了大语言模型的计算挑战,推动了将大语言模型的文本处理能力与文本丰富图的结构复杂性相结合。实验结果表明,HiCom在电子商务图和引用图上进行节点分类,可显著优于GNN和LLM基线模型。对于来自图中稠密区域的节点,HiCom在五个数据集上实现了3.48%的平均性能提升,同时比LLM基线模型更高效。
引用
@article{arxiv.2406.11884,
title = {Hierarchical Compression of Text-Rich Graphs via Large Language Models},
author = {Shichang Zhang and Da Zheng and Jiani Zhang and Qi Zhu and Xiang song and Soji Adeshina and Christos Faloutsos and George Karypis and Yizhou Sun},
journal= {arXiv preprint arXiv:2406.11884},
year = {2024}
}