基于大语言模型的长尾文本属性图插值:SaVe-TAG
人工智能
2026-02-16 v5 机器学习
社会与信息网络
摘要
现实世界的图数据通常遵循长尾分布,使得图神经网络(GNN)在头类和尾类之间难以获得良好的泛化。最近在 Vicinal Risk Minimization(VRM)方面的进展显示出通过数值插值缓解类别不平衡的前景;然而,现有方法主要依赖于嵌入空间的算术运算,无法捕捉文本属性图中固有的丰富语义。本文提出了我们的方法,SaVe-TAG(Semantic-aware Vicinal Risk Minimization for Long-Tailed Text-Attributed Graphs,即语义感知的长尾文本属性图 Vicinal Risk 最小化),一种新的 VRM 框架,利用大语言模型(LLM)执行文本级别的插值,为少数类生成位于流形上且丰富边界的合成样本。为缓解噪声生成的风险,我们引入一种基于置信度的边分配机制,该机制使用图拓扑作为自然过滤器,以确保结构一致性。我们为该方法提供了理论依据,并在基准数据集上进行了广泛实验,表明该方法 consistently优于数值插值和先前的长尾节点分类基线。我们的结果凸显了在文本属性图上实现平衡和有效学习的重要性,以及整合语义和结构信号的必要性。该源代码已公开available at: https://github.com/LWang-Laura/SaVe-TAG。
引用
@article{arxiv.2410.16882,
title = {SaVe-TAG: LLM-based Interpolation for Long-Tailed Text-Attributed Graphs},
author = {Leyao Wang and Yu Wang and Bo Ni and Yuying Zhao and Hanyu Wang and Yao Ma and Tyler Derr},
journal= {arXiv preprint arXiv:2410.16882},
year = {2026}
}
备注
Accepted KDD 2026 Research Track Paper