中文

TEG-DB:文本边缘图的全面数据集与基准

计算与语言 2024-11-26 v3 人工智能

摘要

文本属性图(Text-Attributed Graphs, TAGs)通过自然语言描述增强图结构,促进在各种实际场景中对数据及其相互关系的详细描绘。然而,现有 TAG 数据集主要在节点处包含文本信息,而边缘仅由二元或分类属性表示。这种缺乏丰富文本边缘注释的局限,显著限制了对实体之间语境关系的探索,阻碍了对图结构数据的深入洞察。为此,我们引入文本边缘图数据集与基准(TEG-DB),这是一个包含丰富文本边缘描述的数据集,涵盖节点与边缘的全方位信息。TEG-DB 数据集规模庞大,涉及从引用网络到社交网络等多个领域。此外,我们在 TEG-DB 上进行了大规模基准实验,评估了包括预训练语言模型、图神经网络及其组合等当前技术,能够利用文本节点和边缘信息的能力。我们的目标是推动文本边缘图研究的发展,特别是开发能够利用丰富文本节点和边缘描述以提升图分析并深化对复杂现实网络洞察的技术方法。整个 TEG-DB 项目已作为开源仓库在 GitHub 上公开,地址为 https://github.com/Zhuofeng-Li/TEG-Benchmark。

关键词

引用

@article{arxiv.2406.10310,
  title  = {TEG-DB: A Comprehensive Dataset and Benchmark of Textual-Edge Graphs},
  author = {Zhuofeng Li and Zixing Gou and Xiangnan Zhang and Zhongyuan Liu and Sirui Li and Yuntong Hu and Chen Ling and Zheng Zhang and Liang Zhao},
  journal= {arXiv preprint arXiv:2406.10310},
  year   = {2024}
}

备注

Accepted by NeurIPS 2024