中文

LLMAtKGE:大语言模型作为知识图嵌入的可解释攻击者

计算与语言 2025-10-15 v1 密码学与安全

摘要

知识图嵌入(KGE)的对抗攻击旨在通过删除或插入三元组来破坏模型的链接预测能力。最近的一种黑箱方法尝试纳入文本和结构信息以提升攻击性能,但无法生成人类可读的解释,且表现出较差的可泛化性。在过去几年中,大语言模型(LLM)在文本理解、生成和推理方面展现出强大的能力。本文提出LLMAtKGE,一种新型基于LLM的框架,用于选择攻击目标并生成人类可读的解释。为解决在输入受限情况下为LLM提供充足事实背景的需求,我们设计了结构化提示方案,将攻击明确形式化为多选问题,并纳入知识图事实证据。为解决上下文窗口限制和犹豫问题,我们引入基于语义的过滤器和基于中心性的过滤器,这些过滤器在保留高召回率的同时压缩了候选集合。此外,为高效整合语义和结构信息于过滤器中,我们预计算高阶邻接关系并微调LLM以进行三元组分类任务,以提升过滤性能。在两个广泛使用的知识图数据集上进行实验表明,本攻击超过最强的黑箱基线方法,并通过推理提供解释,同时在表现上与白盒方法持果竞争。综合的消融研究和案例分析进一步验证了其生成解释的能力。

关键词

引用

@article{arxiv.2510.11584,
  title  = {LLMAtKGE: Large Language Models as Explainable Attackers against Knowledge Graph Embeddings},
  author = {Ting Li and Yang Yang and Yipeng Yu and Liang Yao and Guoqing Chao and Ruifeng Xu},
  journal= {arXiv preprint arXiv:2510.11584},
  year   = {2025}
}

备注

13 pages