中文

LLM 理解图数据所需:图参数表示的调查

人工智能 2025-02-19 v2 机器学习 社会与信息网络

摘要

图作为一种关系数据结构,广泛用于分子设计、推荐系统等各种应用场景。最近,大型语言模型(LLM)正重新成为 AI 社区的焦点,因其预期的推理与推断能力。使 LLM 理解基于图的关系数据具有巨大潜力,包括但不限于 (1) 为消除幻觉并突破 LLM 推断期间检索增强生成过程的上下文窗口限制提供外部知识库;(2) 将图数据作为输入,直接解决如蛋白质设计和药物发现等基于图的研究任务。然而,将整个图数据输入 LLM 是不可行的,由于其复杂的拓扑结构、数据规模以及缺乏有效且高效的语义图表示。一个自然问题浮现:是否存在一种图表示可以被自然语言描述,以便 LLM 理解,同时也可作为 LLM 的原始输入?基于统计计算,图规律预先定义了一组参数(如度、时间、直径),通过观察大量真实图数据的拓扑分布来识别其关系与值。我们认为,这种图的参数表示——图规律——是解决 LLM 理解图数据输入问题的方案。本文首先从多个视角回顾图规律的研究,包括图的宏观与微观、低阶与高阶图、静态与动态图、不同观察空间以及新提出的图参数。随后我们回顾了受图规律指导获益的各种实际应用,最后我们结论性地讨论了当前挑战与未来研究方向。

关键词

引用

@article{arxiv.2410.12126,
  title  = {What Do LLMs Need to Understand Graphs: A Survey of Parametric Representation of Graphs},
  author = {Dongqi Fu and Liri Fang and Zihao Li and Hanghang Tong and Vetle I. Torvik and Jingrui He},
  journal= {arXiv preprint arXiv:2410.12126},
  year   = {2025}
}

备注

Preprint, 9 pages