中文

大语言模型能否欺骗图学习?探索文本属性图的通用对抗攻击

人工智能 2026-03-24 v1

摘要

文本属性图 (text-attributed graphs, TAGs) 通过整合每个节点的丰富文本语义和拓扑上下文来增强图学习,但也暴露了通过文本基础对抗表面导致的图学习新型漏洞。近期进展利用多样化的 backbone,如图神经网络 (GNNs) 和预训练语言模型 (PLMs),来捕捉TAGs中的结构和文本信息。这种多样性引出一个关键问题:如何设计能够跨架构通用的对抗攻击,以评估TAG模型的安全性?挑战在于不同backbone-GNNs和PLMs对图模式的感知和编码存在显著差异,且许多PLMs仅通过API访问,限制了攻击在黑盒设置下的可能性。为此,我们提出BadGraph,一种新型攻击框架,通过深入挖掘大型语言模型(LLMs)对一般图知识的理解,联合扰动节点拓扑和文本语义。具体而言,我们设计了目标影响者检索模块,利用图先验构建跨模态对齐的攻击捷径,从而实现高效的LLM驱动扰动推理。实验表明,BadGraph在GNN和LLM驱动的 reasoner之间实现了通用且有效的攻击,性能下降最高可达76.3%,而理论和实证分析确认了其隐形且可解释的特性。

关键词

引用

@article{arxiv.2603.21155,
  title  = {Can LLMs Fool Graph Learning? Exploring Universal Adversarial Attacks on Text-Attributed Graphs},
  author = {Zihui Chen and Yuling Wang and Pengfei Jiao and Kai Wu and Xiao Wang and Xiang Ao and Dalin Zhang},
  journal= {arXiv preprint arXiv:2603.21155},
  year   = {2026}
}

备注

Accepted by TheWebConf (WWW) 2026